原始存档:raw/news/aihot/2026-09-09.md
头条:OpenAI 智能体求解 Navier–Stokes 千禧年难题,引发优先权争议
- OpenAI 宣布由一组智能体使用强于 GPT-6 Astra 的下一代模型,给出 Navier–Stokes 存在与光滑性问题的 blow-up 解(约 90 年未解),附 Lean 形式化验证;全程约 88 小时、490 万条消息、约 3000 亿输出 token,成本数百万美元。
- 争议:NYU 数学家 Buckmaster 与 Anthropic 数学家 Alpöge 称研究进展被泄露给 OpenAI,对方用大量算力沿其路线追赶;OpenAI 声明未访问特定用户数据、双方证明路径不同(Euler 情形 forced vs. unforced);Sam Altman 称曾提议对方先发甚至署名 lead author,协调失败。
- Noam Brown 观点:o3 时代 ARC-AGI 87.5% 花 20 得分更高;预计一年后此类能力人人可用。
- 工程视角:这是大规模 multi-agent 编排 + test-time compute 的标志性案例;Simon Willison 追问的数据使用边界问题值得持续关注。
模型与产品
- ChatGPT Images 2.5 发布:延迟比 2.0 降低最多 50%,细节/编辑精度/参考照片保真度/多轮编辑一致性提升。
- Astra 全面推送:覆盖 Codex 和 ChatGPT Work 的 Plus/Pro/Business/Enterprise 用户。
- Meta Muse 智能体产品开放体验(muse.ai/join):浏览器等 agent 流程表现出色,原生集成 Instagram 等 Meta 产品;soul.md 命名对普通用户不直观。
- Runway Plugins:生成/重绘直接嵌入 Premiere Pro 与 After Effects 时间线,Edit Studio 用 Aleph 2 按原始时长重渲染。
行业与融资
- Mistral 完成 30 亿欧元 D 轮,估值超 210 亿欧元,称欧洲科技公司史上最大股权融资。
- Anthropic 据报道 11 个月内签署高达 5170 亿美元算力协议,锁定至少 14.8 GW,计划自建数据中心(9/8)。
Agent 工程(与本职工作最相关)
- Anthropic 降本三方法(详见 claude-code 生态):prompt cache 命中率最大化、清除升级前沿模型后的提示词反模式(验证仪式/强调词/scratchpad 脚手架/矛盾规则)、按任务校准 effort。实测 prompt-audit 成本降 14.6%、准确率升 5.3%;强模型低 effort 可胜过弱模型高 effort(成本 1/3)。新命令
/claude-api prompt-audit|cost-optimize|hillclimb已内置于 Claude Code 的 claude-api skill。 - GPT-6 Astra Reasoning Effort 分档(卡兹克):各档位是同一模型的不同思考预算,Ultra 类似多智能体协作工作组。
- Tunguz 拆 OpenAI 3x 生产力:每研究员 8 小时班次对应 3.14 个 agent 工作日、并行 4 agent;一半工作仍需人工干预,推理成本激增 40 倍。
- CUA-Lite(Berkeley RDI,9/8):计算机使用智能体开源平台,15+ 基准、30k+ 可验证任务免 VM 沙箱、统一监督数据格式、每模型一个 harness 覆盖评测/SFT/RL。
研究观点
- Dwarkesh Patel:1e19 FLOPs 预算下对照实验,2019-2025 预训练进步中数据改进贡献 12.0x 算力效率,模型改进 3.7x,数据约为模型的 3.24 倍。