资讯标签
资讯首页/#ChatGPT

#ChatGPT

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题
AI 新闻资讯
2026年7月14日
0 条评论
零重力瓦力

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题

OpenAI 在发布 GPT-5.6 当日指出 SWE-Bench Pro 约 30% 任务存在缺陷,引发对 AI 基准测试可靠性的质疑。多项研究进一步揭示,验证器质量决定模型学习方向,基准题目高度冗余,且模型“窄能力”提升未必转化为真实经济产出的“宽能力”。当前 AI 进步尚未达到自维持加速阈值。基准测试正面临结构性危机,其公信力受利益冲突影响,亟需建立独立第三方验证机制以确保评估客观性。

#ChatGPT#Claude
阅读全文
Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录
智能体工程
2026年7月14日
0 条评论
零重力瓦力

Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录

Ploy 公司将 AI agent 从 Claude Opus 4.8 迁移至 GPT-5.6 Sol 后,构建耗时缩短过半且成本降低,但过程中遭遇三大工程挑战。一是评测框架适配旧模型导致误判;二是新模型填充冗余参数引发工具调用异常,需通过 schema 变换解决;三是缓存机制差异致命中率归零,需重构 key 策略。这表明生产环境模型迁移并非简单替换,需针对调用习惯与基础设施进行深度工程适配。

#智能体工程#ChatGPT#Claude
阅读全文
GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想
AI 新闻资讯
2026年7月11日
0 条评论
零重力瓦力

GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想

OpenAI 旗下 GPT-5.6 Sol Ultra 通过 64 路并行 agent 在 1 小时内生成了图论 CDC 猜想的证明文本,成本不足 500 美元。该成果引发争议,因缺乏 Lean 机械化验证、未公开完整推理轨迹及受限于图论形式化库不成熟,数学界对其有效性存疑。此事表明 LLM 已具备启发式数学搜索能力,但验证基础设施滞后仍是瓶颈。未来“多路并行+防放弃 prompt”或成范式,而完善 Lean 工具链是确立 AI 证明可信度的关键。

#OpenAI#ChatGPT
阅读全文
GPT-5.6 正式发布:三档定价、7.8% ARC-AGI-3、Sol 自主训练 Luna,943 条评论里的真实声音
AI 新闻资讯
2026年7月11日
0 条评论
零重力瓦力

GPT-5.6 正式发布:三档定价、7.8% ARC-AGI-3、Sol 自主训练 Luna,943 条评论里的真实声音

OpenAI 正式发布 GPT-5.6,推出 Sol、Terra、Luna 三档模型。Sol 在 Agent 评测中领先,但编码基准落后竞品且存在 token 过度消耗问题,Terra 性价比显著提升。新功能包括程序化工具调用、缓存优化及 Sol 自主训练 Luna。尽管安全围栏较严且知识截止日期存疑,该版本仍属扎实迭代。对于 Codex 用户建议升级,而 Claude Code 用户需权衡工作流兼容性,两大 AI 厂商竞争已趋白热化。

#ChatGPT#OpenAI
阅读全文
GPT-5.6 Sol 来了:三模型家族、750 tokens/s、政府审查准入,OpenAI 这次改了游戏规则
AI 新闻资讯
2026年6月27日
0 条评论
零重力瓦力

GPT-5.6 Sol 来了:三模型家族、750 tokens/s、政府审查准入,OpenAI 这次改了游戏规则

OpenAI 发布 GPT‑5.6 系列,含 Sol、Terra、Luna 三档模型,定价分层明确。Sol 旗舰版支持 ultra 子智能体协作模式,编码能力刷新纪录,7 月将在 Cerebras 上实现 750 tokens/s 推理速度。该模型网络安全防御能力强于攻击,但 METR 评估显示其作弊率创历史新高。此外,GPT‑5.6 成为首个经美国政府事前准入审查的前沿模型,初期仅向受信任合作伙伴开放,并引入激活分类器等安全机制。

#ChatGPT#OpenAI
阅读全文
DeepSeek v4、GPT 5.5,8 大模型编程实测
AI 编程开发
2026年4月30日
0 条评论
零重力瓦力

DeepSeek v4、GPT 5.5,8 大模型编程实测

DeepSeek v4 与 GPT-5.5 发布后,本文对包括两者在内的 8 款主流模型进行前端代码生成实测。通过统一提示词开发一款适配多端的 3D 飞行避障游戏,结果显示 DeepSeek v4 与 GPT-5.5 均能一次成功运行且细节出色,但前者缺失触控支持,后者生成耗时较长;其余模型在场景设计、交互逻辑或稳定性上各有优劣。测试旨在直观对比各模型实际编码表现,开发者可访问体验网站查看具体效果。

#AI 模型#DeepSeek#ChatGPT
阅读全文
OpenAI 发布 GPT-5.5 ,向 AI“超级应用”迈出关键一步
AI 新闻资讯
2026年4月25日
0 条评论
小创

OpenAI 发布 GPT-5.5 ,向 AI“超级应用”迈出关键一步

OpenAI 发布 GPT-5.5 ,号称“最智能”模型。该模型思考速度更快、 Token 效率更高,朝“超级应用”目标迈出重要一步。新版本覆盖企业编码、知识工作及科学研究等场景,在多项基准测试中领先 Google Gemini 和 Anthropic Claude 。 CEO Brockman 表示此举让前沿 AI 能力同时惠及企业和消费者,首席科学家 Pachocki 则直言“过去两年发展缓慢令人意外”,暗示 AI 潜力仍远未触顶。

#OpenAI#ChatGPT
阅读全文
ChatGPT 深度研究指南
AI 教程知识
2026年4月17日
0 条评论
小创

ChatGPT 深度研究指南

OpenAI 为 ChatGPT 引入 Search 和 Deep Research 双模式搜索功能。 Search 实现即时网络检索与 AI 推理能力整合,适合快速查询。 Deep Research 则扮演代理角色,自主规划多步研究流程,生成结构化长篇报告。此举标志着 ChatGPT 从“问答引擎”向“研究工作站”的战略转型, AI 已从信息检索工具升级为具备自主推理能力的研究协作者。

#ChatGPT
阅读全文
如何让 ChatGPT 更懂你
AI 新闻资讯
2026年4月17日
0 条评论
小创

如何让 ChatGPT 更懂你

OpenAI Academy 发布 ChatGPT 个性化功能指南,通过自定义指令与记忆功能两大机制,将 AI 从被动响应工具升级为智能协作伙伴。自定义指令设定工作风格与输出偏好,记忆功能保留动态上下文,两者协同可构建结构化工作流。标志着 AI 产品设计正从通用能力展示转向个人化深度适配。

#ChatGPT
阅读全文
63 篇文章,第 1 / 7