改进 AI 模型预测可解释性的方法

MIT 研究人员提出创新方法,从深度学习模型自身特征中自动提取人类可理解的概念,从而改进概念瓶颈建模技术。该方法利用稀疏自编码器筛选关键特征,再由多模态大语言模型将其转化为文字描述并标注图像,有效解决了传统方法依赖专家预定义概念、信息泄漏等局限。在鸟类识别和医疗诊断等任务上,该方法取得现有最高准确率,为提升 AI 模型可解释性和可问责性提供了新路径。

发布于2026年4月19日 18:22
编辑小创
评论0
阅读27

MIT 新技术让 AI 决策过程更透明

在医疗诊断、自动驾驶等高风险场景中,用户需要理解计算机视觉模型为何做出特定预测,以便判断是否应该信任其输出。概念瓶颈建模( Concept Bottleneck Modeling )正是实现这一目标的主流方法。它强制深度学习模型使用人类可理解的概念集来进行预测,从而解释决策过程。

麻省理工学院的研究人员近日提出了一种创新方法,能够从模型自身学习到的特征中自动提取概念,而非依赖专家预定义的标签。这使得概念的使用更加精准,模型给出的解释也因此更加清晰可靠。该成果由 MIT 计算机科学与人工智能实验室( CSAIL )的研究团队完成,论文将在国际学习表征会议( ICLR )上发表。

传统概念瓶颈模型的局限在于,预定义概念往往缺乏针对性。即便由临床专家设定“集群棕色斑点”“杂色色素沉着”这类概念用于判断黑色素瘤,它们仍可能与具体任务无关或细节不足,导致模型准确率下降。更棘手的是,模型有时会暗中使用未被察觉的特征来预测,这被称为信息泄漏现象。

研究团队另辟蹊径:既然模型已在大量数据上训练,它很可能已经学到了完成特定任务所需的概念。研究人员设计了一套方法,从目标模型中提取既有知识并转化为人类可读的文字描述。

该方法首先使用稀疏自编码器( Sparse Autoencoder )从模型学习到的特征中筛选出最关键的信息,将它们重构为若干概念。随后,一个多模态大语言模型( Multimodal LLM )将这些概念翻译成通俗语言,同时为数据集中的每张图像标注概念的存在与否。基于这份标注数据,研究团队训练了一个概念瓶颈模块来识别这些概念,并将它嵌入目标模型,强制其仅使用提取出的概念集进行预测。

为防止模型绕过概念使用未知特征,研究人员将每个预测限制为最多五个概念。这一约束不仅阻止了信息泄漏,还迫使模型挑选最具相关性的概念,使解释更易理解。

实验结果表明,在鸟类物种识别、皮肤病变诊断等任务上,该方法取得了现有概念瓶颈模型的最高准确率,同时提供了更精确的解释。生成的 concepts 对数据集中的图像更具针对性。

曾是米兰理工大学的访问研究生的第一作者安东尼奥·德·桑蒂斯表示。“从根本上,我们试图读懂计算机视觉模型的‘思维’。概念瓶颈模型让用户能够理解模型在想什么、为何做出某个预测。由于我们的方法使用了更优质的概念,它能够提高准确率,并最终提升黑箱 AI 模型的可问责性。”

研究团队计划进一步解决信息泄漏问题,可能通过增加额外的概念瓶颈模块来堵住漏洞。同时,他们打算使用更大的多模态大语言模型来标注更多训练数据,从而提升性能表现。

德国维尔茨堡大学数据科学讲席教授 Andreas Hotho 评价:“这项工作将可解释 AI 推向了一个非常有前景的方向,在符号 AI 和知识图谱之间建立了自然桥梁。通过从模型自身内部机制而非仅从人类定义的概念中推导瓶颈,它提供了一条通向更忠实于模型的解释的路径。”

该研究得到了 Progetto Rocca 博士奖学金、意大利大学与研究部、泰雷兹阿莱尼亚航天公司以及欧盟“下一代欧盟”项目的支持。

创艺洞察

这项研究的价值在于它重新定义了概念瓶颈模型的构建逻辑。不再是从外部向模型输入人类预设的概念,而是从模型内部“挖掘”它已经学到的知识。这种内省式的方法,本质上解决了一个根本矛盾:人类定义的概念与模型实际使用的特征之间往往存在错位。当模型被迫使用自身提炼出的概念时,它的解释自然会更贴近真实的决策路径,而非表面上的人类语言包装。不过,若要让这种方法真正服务于医疗等高风险领域,还需要在防止信息泄漏与保持预测精度之间找到更稳固的平衡点。从长远看,它或许能为“可解释 AI”与“神经符号系统”的融合开辟出一条可行的技术路径。

相关文章

Visa 把支付网络接进了 ChatGPT,AI 智能体终于能自己花钱了
AI 新闻资讯
2026年6月18日
0 条评论
零重力瓦力

Visa 把支付网络接进了 ChatGPT,AI 智能体终于能自己花钱了

Visa 与 OpenAI 合作将支付网络接入 ChatGPT ,Mastercard 同日发布 Agent Pay for Machines 协议,标志着支付基础设施正式向 AI 智能体开放。Visa 推出 Agent Score 、验证目录及大模型反欺诈工具保障交易安全;Mastercard 则通过链上记录实现权限可验。尽管面临身份碎片化及责任界定等挑战,且短期实用价值有限,但两大巨头同日布局确认了智能体作为经济参与者的地位,开发者命令行支付或成率先落地场景。

#智能体
阅读全文
SpaceX 4320 亿买下 Cursor:马斯克用一场 IPO 的钱,赌 AI 编程的未来
AI 新闻资讯
2026年6月17日
0 条评论
零重力瓦力

SpaceX 4320 亿买下 Cursor:马斯克用一场 IPO 的钱,赌 AI 编程的未来

SpaceX 以 600 亿美元全股票收购 AI 编程工具 Cursor,旨在补齐企业级 AI 产品短板并推广自研 Grok 模型。此举将算力基础设施与产品入口结合,但面临 xAI 团队动荡及文化冲突风险。收购后 Cursor 或调整定价、深度整合 Grok 模型,个人用户权益存变数。交易预计三季度完成,建议开发者关注产品路线图转向及核心人员流失信号,同时该交易也为 AI 编程赛道确立了新估值锚点。

阅读全文
电影大师斯科塞斯开始用 AI 画分镜了
AI 新闻资讯
2026年6月4日
0 条评论
零重力瓦力

电影大师斯科塞斯开始用 AI 画分镜了

导演马丁·斯科塞斯出任 Black Forest Labs 顾问,利用 FLUX 模型辅助新片分镜创作,以提升前期沟通效率。此举标志着好莱坞对 AI 工具的接纳度提升,但也引发关于视觉同质化与艺术独特性的争议。BFL 借此验证“视觉智能”在分镜等中间环节的商业价值,而非替代最终创作。斯科塞斯将 AI 定位为表达工具而非想象替代者,其应用仍局限于筹备阶段,影视行业对 AI 的深度整合尚待观察。

#AI 绘画
阅读全文
互动讨论

评论区

围绕《改进 AI 模型预测可解释性的方法》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。