最新文章
资讯首页/最新文章

最新文章

第一时间掌握 AI 行业动态与实用干货,不错过每一条值得深读的好内容。

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题
AI 新闻资讯
2026年7月14日
0 条评论
零重力瓦力

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题

OpenAI 在发布 GPT-5.6 当日指出 SWE-Bench Pro 约 30% 任务存在缺陷,引发对 AI 基准测试可靠性的质疑。多项研究进一步揭示,验证器质量决定模型学习方向,基准题目高度冗余,且模型“窄能力”提升未必转化为真实经济产出的“宽能力”。当前 AI 进步尚未达到自维持加速阈值。基准测试正面临结构性危机,其公信力受利益冲突影响,亟需建立独立第三方验证机制以确保评估客观性。

#ChatGPT#Claude
阅读全文
Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录
智能体工程
2026年7月14日
0 条评论
零重力瓦力

Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录

Ploy 公司将 AI agent 从 Claude Opus 4.8 迁移至 GPT-5.6 Sol 后,构建耗时缩短过半且成本降低,但过程中遭遇三大工程挑战。一是评测框架适配旧模型导致误判;二是新模型填充冗余参数引发工具调用异常,需通过 schema 变换解决;三是缓存机制差异致命中率归零,需重构 key 策略。这表明生产环境模型迁移并非简单替换,需针对调用习惯与基础设施进行深度工程适配。

#智能体工程#ChatGPT#Claude
阅读全文
GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想
AI 新闻资讯
2026年7月11日
0 条评论
零重力瓦力

GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想

OpenAI 旗下 GPT-5.6 Sol Ultra 通过 64 路并行 agent 在 1 小时内生成了图论 CDC 猜想的证明文本,成本不足 500 美元。该成果引发争议,因缺乏 Lean 机械化验证、未公开完整推理轨迹及受限于图论形式化库不成熟,数学界对其有效性存疑。此事表明 LLM 已具备启发式数学搜索能力,但验证基础设施滞后仍是瓶颈。未来“多路并行+防放弃 prompt”或成范式,而完善 Lean 工具链是确立 AI 证明可信度的关键。

#OpenAI#ChatGPT
阅读全文
如何用 AI 零门槛复刻月入万刀的无人出镜频道
AI 教程知识
2026年7月11日
0 条评论
小创

如何用 AI 零门槛复刻月入万刀的无人出镜频道

AI 博主 ADIL 演示利用 Claude Fable 5 配合 Higgsfield MCP 插件,在 20 分钟内全自动复刻高收益 YouTube 频道。该工作流集成图像、视频及语音生成引擎,可自动分析爆款结构、撰写脚本并一键产出含配音的纪录片视频及封面标签。平台并不排斥优质 AI 内容,此端到端自动化流程将创作耗时从数天缩至十几分钟,大幅降低不露脸创作门槛。未来核心竞争力在于利用工具实现规模化生产与持续运营的能力。

#Higgsfield#视频生成
阅读全文
AI 正在翻译细胞语言,阿尔茨海默症迎来新转机
AI 新闻资讯
2026年7月11日
0 条评论
小创

AI 正在翻译细胞语言,阿尔茨海默症迎来新转机

针对复杂疾病治疗难题,Arc 研究所正利用 AI 构建通用“虚拟细胞”模型。该模型将 RNA 表达视为生命语言,计划四年内通过 CRISPR 和单细胞测序完成 10 亿次实验进行训练。研究人员可借此在电脑模拟中预测基因或化学干预方案,实现从盲目猜测到精准预测的转变。该工具将于今年晚些时候开源,有望在未来四五年内推动个性化医疗及复杂疾病治疗取得临床突破。

#AI 与健康
阅读全文
Google 为何要开发 Gemma 4 模型
AI 产品工具
2026年7月11日
0 条评论
小创

Google 为何要开发 Gemma 4 模型

谷歌推出开源模型 Gemma 4,旨在解决网络受限地区无法使用前沿 AI 的问题。该模型追求内存占用下的智能最大化,首次具备多模态与智能体能力,支持在无网移动端高效运行复杂任务。目前已在乌干达离线医疗系统及秘鲁原住民语言保护等场景中落地应用。通过将大模型蒸馏至终端设备,Gemma 4 摆脱了对云端算力的依赖,推动去中心化开源生态发展,赋能各社区按需构建专属系统。

#开源模型#Google#Gemma
阅读全文
一个人用 Claude 把 53 万行 Zig 重写成 Rust
AI 编程开发
2026年7月11日
0 条评论
零重力瓦力

一个人用 Claude 把 53 万行 Zig 重写成 Rust

Bun 开发者利用 Claude Fable 5 在 11 天内将 53.5 万行 Zig 代码重写为 Rust,以解决内存安全问题。项目采用 64 个 AI 实例并行及对抗性审查机制,耗资约 16.5 万美元。重写后二进制体积缩减 20%,性能提升 2% 至 5%。尽管存在 1.3 万个 unsafe 块和 19 个回归问题引发争议,但该项目验证了 AI 辅助大规模重构的可行性,其分离上下文与对抗审查等方法论具有重要参考价值。

#Claude Code#AI 编程
阅读全文
GPT-5.6 正式发布:三档定价、7.8% ARC-AGI-3、Sol 自主训练 Luna,943 条评论里的真实声音
AI 新闻资讯
2026年7月11日
0 条评论
零重力瓦力

GPT-5.6 正式发布:三档定价、7.8% ARC-AGI-3、Sol 自主训练 Luna,943 条评论里的真实声音

OpenAI 正式发布 GPT-5.6,推出 Sol、Terra、Luna 三档模型。Sol 在 Agent 评测中领先,但编码基准落后竞品且存在 token 过度消耗问题,Terra 性价比显著提升。新功能包括程序化工具调用、缓存优化及 Sol 自主训练 Luna。尽管安全围栏较严且知识截止日期存疑,该版本仍属扎实迭代。对于 Codex 用户建议升级,而 Claude Code 用户需权衡工作流兼容性,两大 AI 厂商竞争已趋白热化。

#ChatGPT#OpenAI
阅读全文
AI 工程的 4 步进化:每一步都站在上一步肩上
智能体工程
2026年7月3日
0 条评论
零重力瓦力

AI 工程的 4 步进化:每一步都站在上一步肩上

AI 工程化演进并非替代而是叠加,包含四个关键维度:Prompt engineering 解决单次输出准确性;Context engineering 通过 RAG 等技术优化信息输入;Harness 赋予模型工具与环境以具备行动能力;Loop 则通过迭代验证提升多步执行稳定性。这四个阶段分别对应模型的表达、记忆、手脚与工程纪律,缺一不可。成熟的 AI 产品需同时整合这四层能力,当前行业仍在探索如何平衡 Loop 的自动化与人工验证机制。

#智能体工程#提示词工程#上下文工程
阅读全文
1459 篇文章,第 1 / 163