AI 不够聪明?也许只是没有给对上下文!

AI 输出质量差往往不是因为模型不行,而是缺乏有效的上下文。近期备受关注的 “上下文工程” 正是解决这一瓶颈。通过数据打通、知识层构建、精准检索和运行时治理,让 AI 获取与任务真正相关的信息。在检索环节,相比基础 RAG,智能体式 RAG 能迭代获取数据,GraphRAG 靠实体关系导航提升精度,上下文压缩则过滤噪音最大化信号。当模型能力边际放缓,上下文工程的质量将成为拉开 AI 应用差距的关键。

发布于2026年5月13日 11:29
编辑小创
评论0
阅读46

很多人觉得AI不好使,第一反应是模型不行,但真正卡脖子的地方往往是上下文。模型不知道该看哪些信息、哪些跟当前任务相关,自然就会一本正经地胡说八道。

而这就是最近很火的“上下文工程”在解决的事。举个例子,你让 AI 帮你准备明天的客户会议材料,没有上下文的模型只会给你一份漂亮但空洞的通用模板。而一个上下文工程做得好的系统,会自动知道你要见谁,去拉最近的工单记录,发现续约快到期了,同时还懂得不把你权限之外的内部定价信息塞进来。输出质量的差距是巨大的,但背后的模型可能一模一样。

要做好上下文工程,核心要解决四个问题。首先是数据打通,企业数据散落在数据库、文档、SaaS 平台、各种 API 里,与其全搬到一个地方,不如用零拷贝联邦查询让 AI 在数据原地直接访问,既保证实时性又不破坏原有权限。其次是知识层的构建,原始数据本身不等于有用的上下文,需要做跨系统的实体解析,把关系和层级映射出来,让数据变成知识。第三是精准检索,“更长不等于更好”,更多上下文不等于更好的上下文,必须按意图、角色、时效去过滤,别拿无关信息干扰模型。最后是运行时治理,权限校验必须发生在检索和响应的每一步,这个智能体能不能查这个数据源、这条结果该不该返回给当前用户,都得实时判断。

在精准检索这块,视频中梳理了几种进阶方案。基础 RAG 大家都熟悉了,切块、向量化、相似度搜索,简单场景好用。智能体式 RAG 则更进一步,AI 会迭代地获取数据,第一轮觉得不够就再去拿,有点像人类做调研的过程。GraphRAG 则用图结构来导航,它关心的是实体之间的关系而非单纯的语义相似度,先通过图找到相关实体和文档,再用向量搜索填充细节,精确度高很多。还有上下文压缩技术,即使模型的上下文窗口很大,噪音多了效果照样变差,所以要对长文档做摘要和优先级排序,在有限窗口里最大化信号。

如今,模型能力的边际提升在放缓,但上下文工程的优化空间还非常大。同样的模型,喂给它的上下文质量不同,输出可以是天壤之别。接下来真正拉开差距的,是谁能把上下文这套基础设施搭得更扎实。

相关文章

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题
AI 新闻资讯
2026年7月14日
0 条评论
零重力瓦力

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题

OpenAI 在发布 GPT-5.6 当日指出 SWE-Bench Pro 约 30% 任务存在缺陷,引发对 AI 基准测试可靠性的质疑。多项研究进一步揭示,验证器质量决定模型学习方向,基准题目高度冗余,且模型“窄能力”提升未必转化为真实经济产出的“宽能力”。当前 AI 进步尚未达到自维持加速阈值。基准测试正面临结构性危机,其公信力受利益冲突影响,亟需建立独立第三方验证机制以确保评估客观性。

#ChatGPT#Claude
阅读全文
Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录
智能体工程
2026年7月14日
0 条评论
零重力瓦力

Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录

Ploy 公司将 AI agent 从 Claude Opus 4.8 迁移至 GPT-5.6 Sol 后,构建耗时缩短过半且成本降低,但过程中遭遇三大工程挑战。一是评测框架适配旧模型导致误判;二是新模型填充冗余参数引发工具调用异常,需通过 schema 变换解决;三是缓存机制差异致命中率归零,需重构 key 策略。这表明生产环境模型迁移并非简单替换,需针对调用习惯与基础设施进行深度工程适配。

#智能体工程#ChatGPT#Claude
阅读全文
GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想
AI 新闻资讯
2026年7月11日
0 条评论
零重力瓦力

GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想

OpenAI 旗下 GPT-5.6 Sol Ultra 通过 64 路并行 agent 在 1 小时内生成了图论 CDC 猜想的证明文本,成本不足 500 美元。该成果引发争议,因缺乏 Lean 机械化验证、未公开完整推理轨迹及受限于图论形式化库不成熟,数学界对其有效性存疑。此事表明 LLM 已具备启发式数学搜索能力,但验证基础设施滞后仍是瓶颈。未来“多路并行+防放弃 prompt”或成范式,而完善 Lean 工具链是确立 AI 证明可信度的关键。

#OpenAI#ChatGPT
阅读全文
互动讨论

评论区

围绕《AI 不够聪明?也许只是没有给对上下文!》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。