十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

万级并发智能体解出 Navier-Stokes:OpenAI 千禧年难题 88 小时冲刺的工程与争议

万级并发智能体解出 Navier-Stokes:OpenAI 千禧年难题 88 小时冲刺的工程与争议 万级并发智能体解出 Navier-StokesOpenAI 千禧年难题 88 小时冲刺的工程与争议原文OpenAI —《On the Navier-Stokes Millennium Prize Problem》https://openai.com/index/navier-stokes-solution一、先讲清楚他们“做出来”了什么9 月 8 日OpenAI 官宣内部 AI 系统给出了 Navier-Stokes 存在性与光滑性问题的解答。这是克莱数学研究所 2000 年起悬赏 100 万美元的七大千禧年难题之一问的是三维流体运动方程会不会在有限时间内“崩掉”已悬置约 90 年。官方同时放出证明文稿 PDF 与 Lean 形式化仓库GitHub 上的 openai/NavierStokesAndEuler并明确表示不申领千禧年奖。先别被“解出难题”四个字带偏结果的方向和直觉相反。这道题的官方表述问的是初始光滑的流体运动是否会一直保持光滑OpenAI 证明的是“不会”——他们构造出一个 blow-up 解初始光滑、静止的流体在光滑外力和始终有限的能量下能在有限时间内形成奇点速度趋于无界。按官方文稿的物理图像说这个解是一个涡旋像意大利面一样向内螺旋并沿轴向拉伸中心越缩越小却越转越快加速度、压力梯度、动量输运、粘性各项精确相消最终留下一个光滑外力、速度却无限大的流场。对应官方问题表述里的 statement C以及 D光滑性在有限时间内失效是可能发生的。二、规模数字88 小时、约 1 万并发智能体、1300 亿 token官方原文给出的工程口径值得 Agent 开发者当“规模基准”记下8 月 28 日一个能力显著强于 GPT-6 Astra 的内部模型开始训练9 月 1 日OpenAI 听到“有两道千禧年难题被人解出”的传言随即启动用该模型评测所有开放千禧年问题9 月 5 日智能体在首批启动约 88 小时后得到 Navier-Stokes 的解答9 月 5—6 日GPT-6 Astra 额外花 17 小时完成 Lean 形式化与机器验证。成本侧的规模同样夸张全部尝试的问题加起来智能体发了 490 万条消息、消耗约 3000 亿输出 token其中单 Navier-Stokes 一项就占 270 万条消息、约 1300 亿输出 token。OpenAI 研究员 Noam Brown 随后在 X 上坦言这次证明“花了几百万美元”但他认为成本会快速下降。三、这不是“一个大模型答题”而是一套分工协作系统官方博客把系统结构讲得很清楚这则新闻最值得 Agent 开发者读的就是这段主体是一组会协作的智能体带工具权限能读缓存的互联网内容、能运行代码产出 Navier-Stokes 结果的那一组规模达到约 1 万个并发智能体按问题变体分工A/B 两组尝试证明“光滑性永远成立”C/D 两组尝试证明“光滑性会失效”最终胜出的是后者用 Codex 做跨组交叉把不同小组的中间洞察互相投喂避免各组在死胡同里空转模型在任务期间持续训练升级新 checkpoint 会即时同步给正在跑的智能体。还有一段前置铺垫在挑战 Navier-Stokes 之前约 100 个智能体先合作约 50 小时解决了无外力 Euler 方程的正则性反例为最终思路做了热身。可以看出这套系统的运行模式更接近“一个研究组织”而不是“一个问答模型”——并行探索、分工对赌、跨组情报、滚动升级每一条都是多智能体工程里可以直接抄走的架构决策。四、题眼17 小时 Lean 验证才是这则新闻真正新的东西先划个边界9 月 6 日我写过 Anthropic 的 Claude 用 11 天形式化证明费马大定理那篇落点在“长跑任务的工程机制”今天这篇的落点在“当智能体的成果要面向外部世界发布时信任如何建立”两篇可以连着读。这次 OpenAI 没有只甩一个结论而是把发现做成机器可检查的 Lean 代码Astra 用 17 小时把 88 小时的成果形式化验证通过后连同论文一起公开。对 Agent 开发者这里有一条可直接迁移的原则——给长跑智能体定“机器可检查的交付物”而不是听它说“做完了”。最小实现是给任务出口挂一道验收断言# acceptance.py —— 给 Agent 的产出加“可执行验收”示意代码非 OpenAI 官方defaccept(result,checks):逐项执行校验全部通过才算任务完成。 checks: 形如 [(名称, 校验函数)]校验函数入参是 Agent 的产出 返回 (bool, 说明)。关键约束验收逻辑不得依赖 Agent 自己的叙述。 forname,fninchecks:ok,notefn(result)ifnotok:raiseAssertionError(f{name}未通过:{note})returnresult调用链是Agent 每次“完成任务”后先经过 accept() 把产物交给一组与模型无关的断言——文件是否生成、格式是否合法、数值是否落在允许区间——全部通过才允许进入下一步或对外发布。规模放大之后这一层就是你自己的“Lean 验证”。五、争议先来后到、信息泄露与数据之问这则新闻的另一半是信任争议必须放一起看否则只看到一半事实背景NYU 数学教授 Tristan Buckmaster 与在 Anthropic 工作的数学家 Levent Alpöge用 Claude 和 Codex主要是 GPT-5.6 Sol围绕相关问题做了近一年8 月 15 日取得突破。他们在声明中称研究进展信息被泄露给 OpenAI后者随后动用大量算力沿同一条路线追赶TechCrunch 报道OpenAI 的 Sebastien Bubeck 否认“不正当竞争”OpenAI 官方回应努力始于 9 月 1 日听到传言之后在对方公开发布前没有以任何途径看过他们的工作也没有访问具体用户数据但承认“无法排除”产品使用产生的去标识化数据帮助模型变强并指出双方证明差异显著Euler 情形一个是 unforced、一个是 forced。OpenAI 表示 9 月 6 日完成后主动联系对方、提议联合发布并承认其在 Euler 问题上的优先权但据 Simon Willison 对双方声明的梳理因与 Anthropic 的竞争关系未邀请 Alpöge 共同署名Sam Altman 在 X 上补充回应对方当时只有 Euler 结果双方协调失败且 OpenAI 被以“抄袭指控”相威胁。Simon Willison 的评论把这件事捅到了工程层面这和网络安全圈“只要有漏洞传言就能挖出漏洞”是同一现象——在数学圈只要知道“某个问题已经有人解出”就可能触发竞争对手砸几百万美元算力抢跑。他同时抛出一个所有重度用 AI 产品做研究的人都该自问的问题如果你在 Codex 里写了半年的草稿它有多少概率进入训练数据最终帮一个竞争者抢先解出你的问题六、给 Agent 开发者的三个提醒与自查清单成本是暂时的流程是长久的。这次几百万美元的证明在 Noam Brown 看来会快速降价。别被单次巨额开销劝退真正值得学的是“万级并发 分工 滚动升级”这套可复制的组织方式评测要防“军备竞赛化”。当传言本身就能触发上亿 token 的追赶时任何排行榜、竞赛、未发表结果都成了信息博弈面。做 Agent 评测要主动隔离信息别让被测模型的数据源和“正确答案的传言”混在一起数据边界要当成架构问题来设计。如果你用某家的 coding agent 推进核心研究去确认它的企业版与数据隔离选项把“会话内容会不会参与训练”写进技术选型清单。自查清单你的长跑任务有没有“机器可检查的交付物”如果没有试着给出口加一道断言你的评测集是否可能被“传言污染”模型能访问的网络是否可能泄漏它正在被考的内容你使用的 AI 产品数据隔离条款是什么OpenAI 原文承认无法排除去标识化产品数据参与训练具体政策以其官网为准。七、收束Navier-Stokes 事件第一次把“智能体做科研”的完整链条摆到大众面前88 小时的并行冲刺、约 1 万个并发智能体的协作、17 小时的机器验证然后是一地鸡毛的署名与信任争议。对 Agent 开发者前一半是工程榜样后一半是安全提醒——能力越大越要把“验证”和“信息边界”当成系统的一部分来设计而不是事后补救。
返回列表