最新文章
GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题
OpenAI 在发布 GPT-5.6 当日指出 SWE-Bench Pro 约 30% 任务存在缺陷,引发对 AI 基准测试可靠性的质疑。多项研究进一步揭示,验证器质量决定模型学习方向,基准题目高度冗余,且模型“窄能力”提升未必转化为真实经济产出的“宽能力”。当前 AI 进步尚未达到自维持加速阈值。基准测试正面临结构性危机,其公信力受利益冲突影响,亟需建立独立第三方验证机制以确保评估客观性。
Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录
Ploy 公司将 AI agent 从 Claude Opus 4.8 迁移至 GPT-5.6 Sol 后,构建耗时缩短过半且成本降低,但过程中遭遇三大工程挑战。一是评测框架适配旧模型导致误判;二是新模型填充冗余参数引发工具调用异常,需通过 schema 变换解决;三是缓存机制差异致命中率归零,需重构 key 策略。这表明生产环境模型迁移并非简单替换,需针对调用习惯与基础设施进行深度工程适配。
GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想
OpenAI 旗下 GPT-5.6 Sol Ultra 通过 64 路并行 agent 在 1 小时内生成了图论 CDC 猜想的证明文本,成本不足 500 美元。该成果引发争议,因缺乏 Lean 机械化验证、未公开完整推理轨迹及受限于图论形式化库不成熟,数学界对其有效性存疑。此事表明 LLM 已具备启发式数学搜索能力,但验证基础设施滞后仍是瓶颈。未来“多路并行+防放弃 prompt”或成范式,而完善 Lean 工具链是确立 AI 证明可信度的关键。
如何用 AI 零门槛复刻月入万刀的无人出镜频道
AI 博主 ADIL 演示利用 Claude Fable 5 配合 Higgsfield MCP 插件,在 20 分钟内全自动复刻高收益 YouTube 频道。该工作流集成图像、视频及语音生成引擎,可自动分析爆款结构、撰写脚本并一键产出含配音的纪录片视频及封面标签。平台并不排斥优质 AI 内容,此端到端自动化流程将创作耗时从数天缩至十几分钟,大幅降低不露脸创作门槛。未来核心竞争力在于利用工具实现规模化生产与持续运营的能力。
AI 正在翻译细胞语言,阿尔茨海默症迎来新转机
针对复杂疾病治疗难题,Arc 研究所正利用 AI 构建通用“虚拟细胞”模型。该模型将 RNA 表达视为生命语言,计划四年内通过 CRISPR 和单细胞测序完成 10 亿次实验进行训练。研究人员可借此在电脑模拟中预测基因或化学干预方案,实现从盲目猜测到精准预测的转变。该工具将于今年晚些时候开源,有望在未来四五年内推动个性化医疗及复杂疾病治疗取得临床突破。
Google 为何要开发 Gemma 4 模型
谷歌推出开源模型 Gemma 4,旨在解决网络受限地区无法使用前沿 AI 的问题。该模型追求内存占用下的智能最大化,首次具备多模态与智能体能力,支持在无网移动端高效运行复杂任务。目前已在乌干达离线医疗系统及秘鲁原住民语言保护等场景中落地应用。通过将大模型蒸馏至终端设备,Gemma 4 摆脱了对云端算力的依赖,推动去中心化开源生态发展,赋能各社区按需构建专属系统。
