OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开_今热点_财经快报网

来源：量子位

没想到，打开AI黑盒这件事，可能还要靠AI自己来实现了。

OpenAI的最新研究来了一波大胆尝试：

(资料图片)

让GPT-4去解释GPT-2的行为模式。

结果显示，超过1000个神经元的解释得分在0.8以上——也就是说GPT-4能理解这些神经元。

要知道，“AI黑箱难题”长期以来是一个热议话题，尤其是大语言模型领域，人类对其内部工作原理的理解还非常有限，这种“不透明化”也进一步引发了人类对AI的诸多担忧。

目前推进AI可解释性研究的一个简单办法，就是逐个分析大模型中的神经元，手动检查以确定它们各自所代表的数据特征。

但对于规模已经达到百亿、千亿级别的大规模神经网络来说，工作量和工作难度就都涨了亿点点吧。

由此，OpenAI的研究人员想到，干嘛不让AI去自动化搞定这个大工程？

在这项最新的研究中，他们将GPT-4打造成了一个理解AI行为模式的工具，把GPT-2超过30万个神经单元都解释了一遍，并和实际情况比对进行评分。

最终生成的解释数据集和工具代码，已对外开源。

研究人员表示：未来，这种AI工具可能在改善LLM性能上发挥巨大作用，比如减少AI偏见和有害输出。

解释接近人类水平

具体来看，整个研究的步骤可以分为三步。

第一步，先给GPT-4一段文本，并展示GPT-2在理解这段文本时激活的神经元情况。

然后让GPT-4来解释，这段文本中神经元的激活情况。

比如示例中给出了一段漫威复联的文本，GPT-4分析的激活神经元为：

电影、角色和娱乐

第二步，让GPT-4开始模拟，这些被解释的神经元接下来会做什么。

GPT-4给出了一段内容。

第三步，让GPT-2真实的神经元激活来生成结果，然后和GPT-4模拟的结果进行比对，研究人员会对此打分。

在博客给出的示例中，GPT-4的得分为0.34.

使用这个办法，研究人员让GPT-4解释了GPT-2一共307200个神经元。

OpenAI表示，使用这一基准，AI解释的分数能接近人类水平。

从总体结果来看，GPT-4在少数情况下的解释得分很高，在0.8分以上。

他们还发现，不同层神经元被激活的情况，更高层的会更抽象。

此外，团队还总结了如下几点结论：

如果让GPT-4重复解释，它的得分能更高

如果使用更强大的模型来解释，得分也会上升

用不同的激活函数训练模型，能提高解释分数

总结来看就是，虽然GPT-4目前的表现一般，但是这个方法和思路的提升空间还有很大。

团队也强调，现在在GPT-2上的表现都不太好，如果换成更大、更复杂的模型，表现也会比较堪忧。

同时这种模式也能适用于联网的LLM，研究人员认为可以通过简单调整，来弄清楚神经元如何决策搜索内容和访问的网站。

此外他们还表示，在创建这个解释系统时并没有考虑商业化问题，理论上除了GPT-4，其他LLM也能实现类似效果。

接下来，他们打算解决研究中的这几个问题：

AI神经元行为十分复杂，但GPT-4给的解释非常简单，所以有些复杂行为还无法解释；

希望最终自动找到并解释复杂的整个神经回路，神经元和注意力头一起工作；

目前只解释了神经元的行为，但没解释行为背后的机制；

整个过程算力消耗巨大。

网友：快进到AI创造AI

意料之中，这项研究马上在网络上引发热议。

大家的脑洞画风be like：“AI教人类理解AI。”

“AI教人类关掉AI中存在风险的神经元。”

还有人开始畅想，AI理解AI会快速发展为AI训练AI（已经开始了），然后再过不久就是AI创造新的AI了。

当然这也引发了不少担忧，毕竟GPT-4本身不还是个黑盒嘛。

人类拿着自己不理解的东西，让它解释另一个自己不理解的东西，这个风险emm……

这项研究由OpenAI负责对齐的团队提出。

他们表示，这部分工作是他们对齐研究的第三大支柱的一部分：

我们想要实现自动化对齐。这种想法一个值得思考的方面是，它可能随着AI的发展而扩展更多。随着未来AI模型变得越来越智能，我们也能找到对AI更好的解释。

推荐内容

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开_今热点

2023-05-10
金价还能创新高？"2年行情才走了半年"！机构犀利预判：有两大坚实支撑

2023-05-10
5天回购22亿美元！无惧盈利下滑，美国企业大举回购股票|世界快资讯

2023-05-10
期权IV追踪 | 业绩指引大超预期！诺瓦瓦克斯医药隐含波动率连日上升；PacWest期权交易量大幅萎缩

2023-05-10
全球观天下！内银股遭沽售！北水卖出建设银行、工商银行，逆势买入腾讯超6亿港元；南水抢筹中国平安超6亿元

2023-05-10
美国M2暴跌成4月CPI“降温神器”？天天要闻

2023-05-10
理想Q1营收188亿元同比接近翻倍！净利润9.3亿元实现扭亏全球快消息

2023-05-10
港市速睇 | 科指午后小幅转涨，锂电、汽车股表现强势，天齐锂业飙涨超11%，长城汽车涨超6%

2023-05-10
OpenAI发布炸裂研究：让AI解释AI黑箱，人类无法理解，语言无法描述

2023-05-10
对冲大神德鲁肯米勒：美国经济处于衰退边缘，预计将出现硬着陆

2023-05-10
每日期权跟踪 | 绩后飙涨超23%！数据分析巨头Palantir期权成交量放大3倍；支付巨头PayPal大跌近13%，多张看涨期权成交火热

2023-05-10
理想汽车2023年Q1营收187.9亿元，同比增长96.5%

2023-05-10
美国劳动力缺口有望在9月收敛，达成降息条件

2023-05-10
阿里巴巴将于下周四披露23Q1业绩，一图速览大行最新评级及目标价|天天通讯

2023-05-10
“股神”又买对了！巴菲特所投日企的业绩与股价齐飞

2023-05-10
中概科网股财报季打响，京东率先揭榜！一图速览机构最新预测

2023-05-10
当前视讯！读懂巴菲特：油企迈入历史性稀缺时代！

2023-05-10
沙特阿美派息规模傲视全球！远超苹果、微软等巨头

2023-05-10
系好安全带！高盛警告：量化交易员涌入美股或加剧波动

2023-05-10
世界动态:港股概念追踪 | 打磨七年之久！苹果今年6月将推出MR头显，受益港股一览

2023-05-10
前瞻指引“暴雷”，Airbnb股价重挫12%，全球旅游业刚复苏就要凉了？

2023-05-10
关键窗口期！拜登七天内搞不定债务上限，美国就麻烦了环球实时

2023-05-10
内房股继续回落，多城4月份成交数据大幅下滑，各地分化行情或加剧全球即时看

2023-05-10
港股午评 | 三大指数震荡走弱，恒指跌0.72%；汽车、锂电股逆市上扬，长城汽车涨超6%

2023-05-10
锂电池概念股持续走高，碳酸锂报价重回20万元/吨大关，机构称锂板块有望迎来反弹

2023-05-10
全球观点：百度正在内测文心千帆大模型平台

2023-05-10
盘中速览 | 港股走势疲弱，科网股、内银股集体走低，四大行齐挫约2%；汽车、锂电池股上扬-全球热资讯

2023-05-10
世界快看：高盛下调腾讯目标价至442港元评级「买入」

2023-05-10
港股异动 | 长城汽车涨超8%领涨汽车股，机构看好二季度新能源汽车需求回升天天看点

2023-05-10
【天天报资讯】恒生指数开盘跌0.04%，中芯国际、阿里巴巴涨近1%

2023-05-10
港股概念追踪 | 一季度订单超去年全年，有船企排到2026年！中国造船业正迎来新一轮繁荣(附概念股)-全球即时看

2023-05-10
谷歌开发者大会前瞻：AIGC或成主角，大模型PaLM 2首次亮相全球热头条

2023-05-10
腾讯大动作！直接"开战"抖音、快手、小红书

2023-05-10
最热风口ChatGPT“降温”了？世界今头条

2023-05-10
AI圈大事件盘点丨2023年5月10日

2023-05-10
持续震荡的港股处于什么估值水平？世界热资讯

2023-05-10
油气价格下滑拖累利润，西方石油Q1业绩不及预期

2023-05-10
6月美联储利率决议前的最大风险：债务上限和通胀数据

2023-05-10
系好安全带！美国CPI今夜来袭，高盛和小摩已提前写好剧本？

2023-05-10
公告精选 | 伊泰煤炭拟溢价约8.97%将H股私有化；舜宇光学科技4月手机镜头出货量同比下降25.3%_天天快看点

2023-05-10
今日快看!债务僵局未破冰！白宫会晤后共和党领袖称没新动向，民主党坚持不和减支捆绑

2023-05-10
当前速看：成交额TOP20 | 财报强劲！Palantir绩后大涨逾23%，成交20.8亿美元；PayPal绩后跌近13%

2023-05-10
观点 | 市场不确定性加剧之际，这两只股息收益率超9%的美股值得关注世界实时

2023-05-10
全球热文：如何减少投资判断失误？这招教你确定股票价值

2023-05-10
美股三大指数集体走低，市场避险情绪显著！哪些事件在打击华尔街信心？焦点快报

2023-05-09
美国地区性银行股波动剧烈，SEC有必要实施卖空禁令吗？

2023-05-09
诺瓦瓦克斯医药暴涨超46%，全年营收指引远超预期，将裁员25%并削减其他成本|世界头条

2023-05-09
不差钱！苹果为何还发债？其中传递出什么信号？

2023-05-09
美股三大指数集体低开，Palantir逆市涨近15%

2023-05-09
股价与业绩齐飞！大数据公司Palantir绩后大涨近18%，华尔街却看到这些隐忧

2023-05-09