09

2026-09-09日报

7 条精选3 组来源

千禧难题破壁、数据扩展律与资本主权:前沿 AI 给出流体奇点证明,算力膨胀下的真实效率与工程代价

人工智能正在以超乎预期的速度从“经验型工程工具”跃迁为“深层科学发现引擎”,而伴随这种跃迁而来的,是一场关于技术突破归属权、科研范式代际冲突与真实生产力经济账本的全面震荡。OpenAI 正式发布重磅成果,宣布其内部下一代 AI 系统已成功攻克困扰数学界近百年的核心堡垒——纳维-斯托克斯(Navier–Stokes)方程的存在性与光滑性这一千禧年大奖难题(Millennium Prize Problem),证明在特定光滑初始速度场下,不可压缩黏性流体将在有限时间内产生速度梯度发散并形成物理奇点(blowup),并同步提交了经 Lean 交互式证明器完整形式化验证的代码库。然而,这一划时代的数学成就尚未获得同行的充分咀嚼,便迅即卷入了一场涉及学术道德与资本算力霸凌的跨机构舆论风暴:纽约大学数学家特里斯坦·巴克马斯特(Tristan Buckmaster)联合 Anthropic 核心学者公开指控 OpenAI 疑似通过非公开渠道获取了其核心技术线索,并利用上万个智能体和数百万美元的暴力测试时计算(Test-Time Compute)抢跑超车;OpenAI 首席执行官萨姆·奥尔特曼与研究主管塞巴斯蒂安·布贝克则出面强力反击,直斥抄袭指控毫无根据,揭示双方在求解路线与方程覆盖面上的根本差异。这场争端不仅是两家前沿实验室的激烈交锋,更标志着由工业级算力集群主导的自动化科学发现正式打破了传统黑板与粉笔的象牙塔学术秩序。

在数学理论取得震撼破壁的同时,关于通用人工智能底层扩展动力学的科学认知正在经历一场去伪存真的深刻校准。独立研究者德瓦克什·帕特尔(Dwarkesh Patel)发布了一项里程碑式的隔离对照实证研究,通过在严格受控的 1e19 FLOPs 算力预算下交叉训练 2019 至 2025 年间各年度的模型拓扑与开源数据配方,首次以硬核实验量化证实:在过去六年的预训练计算效率提升中,高达 3.24 倍的收益直接源于数据工程与精细清洗过滤(贡献 12.0 倍提升),而模型架构自身的改进仅带来 3.7 倍提升。这一结论彻底重构了行业对模型创新的价值定位——算法架构演进的根本使命并非单纯在固定算力下挤出微小指标,而是如同打造承载风浪的超级集装箱货轮,为数万张集群吞吐海量数据扫清物理瓶颈。与这种对底层数据与模型掌控力相呼应的是地缘科技主权的全面觉醒:欧洲领头羊 Mistral AI 宣布斩获高达 30 亿欧元的 D 轮巨额融资,投后估值跨越 210 亿欧元大关,以欧洲科技史上最大单笔股权融资为支点,构筑起涵盖模型权重、自营算力与企业软件的三位一体“全栈主权 AI 层”,为全球对冲硅谷云厂商垄断提供了最具分量的实体壁垒。

然而,当技术狂欢步入商业深水区,真实的工程账本与生产力代价开始以冰冷的数字刺痛每一个决策者。著名风投家托默·通古斯(Tom Tunguz)系统拆解了 OpenAI 内部“自动化研究实习生”的运作明细:尽管每名人类研究员对应 3.14 个智能体工作日的产出倍增,但其代价是在短短五个月内,单人每日推断支出从 14 美元暴增 40 倍至逾 600 美元,高强度研究席位年化推断成本甚至冲破 250 万美元大关;与汽车制造中作为固定资产长期折旧的工业机器人不同,纯粹作为营运支出(OPEX)的推断算力正对企业的现金流防线提出严峻考验。面对这一现实压力,降本增效的精细化工程正在成为新的显学:Anthropic 官方下场释出核心指南,指导开发者通过固化前缀最大化提示词缓存(Prompt Cache)命中率、清洗升级残留的反模式并动态微调推理 Effort 预算,在保持高智力水平的同时遏制账单失控。与此同时,多模态应用层亦加速向生产力终端渗透,OpenAI 推出了生成延迟骤降 50% 并支持直接批注修图的 ChatGPT Images 2.5,同时向全量付费订阅梯队普及 Astra 桌面接管能力;Runway 则顺势发布深度集成于 Adobe Premiere Pro 与 After Effects 时间轴的原生插件,彻底终结了视频后期中繁琐的导出导入循环。从纯理论证明的崇高殿堂到每行 API 调用的毫厘必争,人工智能正以前所未有的张力在科学与商业的双重轨道上极速重构人类文明的技术底座。

01

千禧难题破壁与机器科研博弈

2 篇

  1. 2026-09-08OpenAI Research / Noam Brown

    OpenAI 宣布以内部 AI 系统解答 Navier–Stokes 千禧年难题:上万智能体推导有限时间奇点,Lean 形式化验证与数百万美元算力账本

    OpenAI 官方正式宣布其研发团队通过内部自动化研究系统,给出了三维不可压缩流体纳维-斯托克斯(Navier–Stokes)方程存在性与光滑性这一千禧年大奖难题(Millennium Prize Problem)的突破性解答。作为克雷数学研究所(Clay Mathematics Institute)于 2000 年设立的七大千禧难题之一,该问题关乎流体力学最基础的物理自洽性,自 1934 年让·勒雷(Jean Leray)提出弱解概念以来,流体是否存在初始光滑但在有限时间内能量无限集中导致速度发散的“爆破点”(Singularity/Blowup),悬而未决已近一个世纪。

    根据披露的初步技术文稿,该项证明是由一个多智能体协作集群驱动的内部下一代基础推理模型自主完成,其综合逻辑推理能力显著凌驾于当前发布的 GPT-6 Astra 之上。为了彻底消除传统大模型生成复杂数学长程推演时难以避免的隐蔽逻辑漏洞与幻觉,OpenAI 采取了“自然语言推演草稿 -> 细粒度逻辑引理拆解 -> 符号自动化翻译 -> 交互式定理证明器形式化校验”的全自动化闭环流程。系统不仅产出了长达数百页的经典数学分析文稿,更同步公开了经 Lean 定理证明器逐行检验通过的形式化验证代码,确立了初始平滑流体在有限时间内速度场梯度发散的严格存在性定理,同时作为副产物顺带证明了三维欧拉(Euler)方程对应的一系列爆破猜想。

    这篇划时代证明背后的计算代价亦展现出惊人的工业体量。OpenAI 强化学习与推理核心专家诺姆·布朗(Noam Brown)在社交平台公开证实,为了调度上万个协同智能体穷举数学假设与搜索证明树,该项目在数周内实际消耗的测试时计算(Test-Time Compute)开销高达数百万美元。然而布朗极其笃定地指出,这笔高昂的账单正是未来技术普及的历史先声:“当 OpenAI 最初发布 o3 时,在 ARC-AGI 评测上刷出 87.5% 的高分同样耗费了近 50 万美元的推理算力;而到了今天,GPT-6 Astra 仅凭约 20 美元的成本便能取得更优的成绩。在 2025 年,前沿实验室需要动用庞大的算力中心才能在国际数学奥林匹克(IMO)中斩获金牌;而到了 2026 年,任何一位购买了 20 美元月费的普通 ChatGPT 用户都能轻易获得同等能力。”布朗强调,测试时计算的成本正在经历指数级的极速滑落,以数百万美元破译前沿未解难题只是机器科学时代的起点,在未来一年内,这种顶尖科学家级别的推理系统将迅速演化为全人类唾手可得的普惠基建。

  2. 2026-09-08TechCrunch / Tristan Buckmaster / Sam Altman

    千禧难题证明归属引爆学界与前沿巨头交锋:NYU 数学家 Buckmaster 联合 Anthropic 控诉抢跑,Sam Altman 与 Bubeck 发文全面回应

    OpenAI 奇点证明的发布并未如预期般迎来学界的纯粹赞誉,反而瞬间引爆了一场关于学术道德、泄密疑云与工业算力抢跑的跨机构空前争端。纽约大学柯朗数学研究所(Courant Institute)知名数学教授特里斯坦·巴克马斯特(Tristan Buckmaster)与 Anthropic 全职数学研究员勒万特·阿尔珀格(Levent Alpöge)发表公开声明,宣布他们近期在不可压缩多孔介质方程以及三维欧拉方程的有限时间奇异点构造上取得了决定性突破,并严厉指责 OpenAI 在千禧难题求解竞赛中存在“极不光彩的不正当竞争”。

    巴克马斯特在声明与对外采访中披露了一份详尽的时间线,指控在过去两周内,其处于保密阶段的数学思路与技术进展疑似通过私人沟通渠道遭到泄露。巴克马斯特称,OpenAI 在获悉其推演架构后,立刻调动了人类学者难以企及的庞大超算资源沿着其独特的数学路径发起围追堵截,试图赶在传统学术同行评议流程走完之前凭借算力暴力抢先宣称千禧年难题的成果。阿尔珀格甚至一度向 OpenAI 发出法律与抄袭指控警告,指责其侵蚀了学术创新的原创性土壤。

    面对汹涌的舆论指控,OpenAI 首席执行官萨姆·奥尔特曼(Sam Altman)与主管数学智能体研究的塞巴斯蒂安·布贝克(Sebastien Bubeck)随即公开发表长文展开全面澄清与反驳。奥尔特曼指出,研发团队最初完全是因为社区传闻 Anthropic 模型已攻克千禧难题,出于纯粹的好奇心才迅速立项验证己方下一代系统的推演极限。奥尔特曼披露,在得知对方实际上仅攻克了欧拉方程、尚未完成带粘性项的完整 Navier-Stokes 证明后,OpenAI 曾主动展现出最大的学术谦逊与合作诚意——甚至提议由对方团队优先发布、由其独享千禧年大奖,并邀请巴克马斯特作为 OpenAI 证明公开重写版的领衔作者;然而这一协调意向遭到了对方团队的拒绝,反而换来了毫无事实根据的抄袭威胁。

    布贝克进一步从纯数学机理上澄清,两家团队公布的手稿显示,双方在构造奇异点时采用的泛函工具、尺度变换不变性分析以及空间对称性假定存在本质差异,完全属于两条截然不同的数学拓扑路线。这场激烈的交锋深刻揭示出在通用人工智能时代,传统以个人和象牙塔为中心的科研信誉认定机制正在遭受不可逆的动摇:当拥有无限算力和自主智能体兵团的前沿实验室能够将原本需要人类数学家数年深思的猜想验证压缩至数天之内,科学发现的伦理边界、专利壁垒与首发权的界定规则,已然被推入了前所未有的制度荒原。

02

资本主权与扩展律底层分水岭

2 篇

  1. 2026-09-08Mistral AI Official Announcement

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元:欧洲史上最大股权融资,打造全栈“主权 AI”防线

    欧洲人工智能领军独角兽 Mistral AI 正式宣布完成规模高达 30 亿欧元的 D 轮股权融资,投后估值一举跨越 210 亿欧元大关。这不仅创下了欧洲大陆科技创业史上单轮股权融资的最高历史纪录,更标志着这家创立仅三年的巴黎实验室,已经拥有了与硅谷超大规模巨头正面博弈的庞大资本防线。

    本轮融资展现出极其罕见的跨国产业资本与主权实体联合背书:全球消费电子巨头三星电子(Samsung Electronics)作为新晋领投方出资,欧洲知名私募巨头 EQT 旗下的 Scaleup Europe 基金与既有投资方 PSG Equity 联合领投;同时,全球最大资产管理公司贝莱德(BlackRock)管理的基金与账户、私募股权巨头 Advent 以及卢森堡大公国作为新主权股东重磅入局;此外,包括 a16z、光刻机霸主 ASML、法国国家投资银行(Bpifrance)、英伟达(NVIDIA)、Salesforce Ventures 以及 DST Global 等顶级战略与财务投资者亦悉数行使了追加跟投权。

    在随融资释出的战略宣言中,Mistral 深刻剖析了全球政企客户在经历生成式 AI 第一波狂潮后的集体清醒:当早期单纯追逐模型参数跑分的光环退去,全球政府与受监管核心企业(如空客 Airbus、ASML、汇丰银行 HSBC 等)开始普遍追问一个生死攸关的战略命题——如何在利用前沿智能重塑核心业务流程的同时,绝不将关键知识产权、国家安全数据与系统生命线出卖给受制于单一跨国云寡头的封闭 API?针对这一痛点,Mistral 将自身定位为全球唯一的“全栈主权 AI 层”(Sovereign AI Stack),其商业护城河牢牢立足于四大自主控制维度:

    1. **数据绝不出境**:确保所有业务流、内部专有语料与推理上下文永久沉淀在组织物理边界与合规主权管辖之内;

    2. **模型透明可控**:坚持开放权重路线,允许企业深度微调乃至拥有自主定制的模型参数分叉,避免陷入供应商锁定;

    3. **私有可预测算力**:依托在欧洲本土以及沙特等中东主权基础设施伙伴搭建的低碳数据中心,提供脱离公有云配额挤压的确定性算力供给;

    4. **全链路可审计交付**:从数据预处理、推理调用到最终业务决策执行,提供完全透明、符合严苛法案审计要求的生产级企业软件闭环。

    这笔巨额资金的注入,标志着欧洲乃至全球非美科技生态正在打破对硅谷基础模型的单向依赖,以“控制权与高性能并重”的全新范式重构全球算力秩序。

  2. 2026-09-08Dwarkesh Patel Podcast & Blog

    Dwarkesh Patel 深度实证研究:2019–2025 预训练进步 3.24 倍来自数据改进而非模型架构

    在行业长期关于“预训练的日新月异到底归功于模型架构革新还是高质量数据工程”的无休争辩中,知名科技播客兼 AI 研究者德瓦克什·帕特尔(Dwarkesh Patel)发布了一份详尽的实验分析,以高度受控的小规模严谨对照实验给出了震撼性的量化答案。

    为了消除训练算力与评估尺度的干扰,研究团队在最高达 1e19 FLOPs 的严格固定算力预算下,系统回测了 2019 年至 2025 年间 AI 领域的关键技术演变。在那六年中的每一年,开源社区都会诞生一个凝聚当年全部公开算法创新的代表性模型方案(从 2019 年的原始 GPT-2,到涵盖 RMSNorm、SwiGLU 激活、旋转位置编码 RoPE、自适应学习率优化器等全面改良的 OLMo-2 配方);而在每一年,公网抓取与清洗管线亦会产出一个跨越时代的全新语料库(从最初仅收录 Reddit 高赞外链、去重后仅 9B Token 的 OpenWebText,演进至采用启发式过滤与自动化分类器层层筛选的十万亿级现代语料 UltraFineWeb)。研究团队通过笛卡尔积交叉组合,训练了不同年份“模型架构 x 数据语料”的全部矩阵,并统一采用包含 10 项核心下游问答任务的 OLMES 综合基准测试衡量最终能力。

    数据统计结果展现出压倒性的倾斜:在相同的 1e19 FLOPs 算力约束下,从 2019 到 2025 年,计算效率提升中的 3.24 倍完全由数据配方的改进所贡献,而模型架构改进仅贡献了 1.0 倍(具体而言,数据改进带来了 12.0 倍的算力利用率跃升,而模型架构仅带来 3.7 倍提升)。线性回归模型表明,模型演进与数据工程带来的能力收益表现出高达 88% 的可解释方差,两者在统计学上几乎完全相互独立,彼此不存在显著的强绑定协同。这表明高质量数据并不挑剔底层结构,其带来的认知密度提升具有全方位的通用普适性。

    然而,帕特尔在分析中严肃反驳了“模型研究已死、唯有数据为王”的轻浮解读。他指出,模型架构改进的根本价值从来不在于单纯在低算力区间节省计算步数,而在于“打造一艘能够抵抗惊涛骇浪的超级集装箱货轮”。早期模型如同一艘脆弱的木质帆船,稍加大规模参数或加深层数便会遭遇梯度爆炸、显存墙与数值崩溃;正是 MoE 稀疏路由、FlashAttention 算子优化以及初始化规范等关键架构创新,才使得前沿实验室得以在数十万张 GPU 集群上稳定驾驭数百亿乃至数万亿 Token 的无损训练。模型研究解决了容纳算力的天花板,而数据工程则决定了往这个算力黑洞中灌注何种密度的文明精华。随着基础模型向后训练与测试时推理全面倾斜,数据质量与规模之间关于“过度训练(Over-training)”的平衡取舍,将成为下一代 Scaling Law 必须直面的核心科学瓶颈。

03

工程经济学与多模态创作管线

3 篇

  1. 2026-09-08Tomer Tunguz Blog

    Tom Tunguz 拆解 OpenAI 3x 研发生产力神话:Agent 工作日虽倍增,中位数推断成本暴增 40 倍,纯 OPEX 模式考验企业现金流

    著名风险投资家托默·通古斯(Tom Tunguz)撰文,对 OpenAI 日前在其内部研究加速报告中所标榜的“AI 赋能下实现 3 倍科研生产力增益”的宏大叙事展开了冷静的财务还原与工程解构。通古斯直言,市场目前充斥着“AI 将生产力瞬间放大数倍”的盲目乐观,但深入审视 OpenAI 披露的微观数据就会发现,这种所谓的效率跃迁在本质上是“机器不知疲倦地全天候运转”,且背后附带了一份极其昂贵的工业级财务账单。

    通古斯援引数据指出,在 8 月中旬,OpenAI 内部研发人员每完成一个标准的 8 小时人类工时,其后台协同的自动化智能体系统平均会同步记录下 3.14 个智能体工作日(Agent-workdays);典型的资深研究员在日常工作中往往并发调度 4 个完全自主的智能体,分头推进文献梳理、算法实验、多参数扫描以及测试用例编写。然而,这种多智能体协作并非完全无人干预的自由闭环——数据显示,系统近一半的中间推进依然离不开人类专家的手工介入与纠偏。

    更为致命的是支撑这一庞大机器工时背后的算力通胀。今年 3 月底,OpenAI 内部研究人员每日所消耗的中位数推断(Inference)费用仅为 14 美元;而到了 8 月中旬,这一账单中位数已然激增至每日超过 600 美元——在不到五个月的时间内发生了整整 40 倍的惊人膨胀。而在研发团队的高端梯队中,处于第 90 百分位的前沿研究员每日仅推断开销就超过 7,000 美元,折合每个研发席位的年化推断成本高达惊人的 250 万美元。

    通古斯由此提炼出一个关乎企业财务健康的根本性商业悖论:在人类工业史上,年耗资数百万美元的生产设备通常是汽车冲压车间里的重型焊接机器人,企业可以通过将其计入资本开支(CAPEX),在数年乃至十数年的资产负债表上平稳折旧摊销;然而在大模型时代,支撑自主智能体推断的每一个 Token 消耗,都是计入损益表的纯粹营运支出(OPEX)。这种没有固定资产沉淀、按秒燃烧现金流的高密度运算,直接对企业的毛利率与经营性现金流构成了巨大的下行拉力。通古斯警告,单纯夸耀多智能体并行而忽视每 Token 边际生产力的商业模式注定无法持续,企业界亟需建立起跨越工程执行与财务精算的确定性监控体系。

  2. 2026-09-08Claude Devs (@ClaudeDevs)

    Anthropic 官方发布 Claude Platform 降本增效指南:最大化 Prompt Cache 命中率、清除升级反模式与动态任务 Effort 预算

    针对广大企业开发者在构建复杂长程智能体时所面临的调用成本飙升难题,Anthropic 官方开发团队(Claude Devs)发表深度技术专栏,系统打破了“追求顶尖模型性能就必须忍受昂贵成本”的传统思维定势。官方团队结合内部编码工具 Claude Code 以及新推出的 `claude-api` 技能库实战经验,公布了三大可在完全不牺牲模型输出质量前提下大幅削减综合调用成本的黄金工程法则:

    1. **构筑钢铁般的提示词缓存(Prompt Cache)**:在基础模型推理生命周期中,前置处理输入文本并构建内部键值状态(Prefill / KV Cache)是能耗与费用最昂贵的环节。通过保持提示词前缀的一致性,复用缓存的单价仅为常规输入价格的极小一部分。Anthropic 警告开发者必须彻底消除以下破坏缓存的“暗坑”:

    2. **清除模型升级残留的提示词反模式(Prompt Anti-Patterns)**:团队发现,许多开发者在将底层模型从较弱的老旧版本无脑迁移至新一代高智力模型(如 Claude Opus 5 系列)后,依然机械地保留了大量针对上一代模型缺陷而设计的“防御性脚手架”——例如动辄数千字的否定性格式禁令、冗长僵硬的思考模板与重复性自我校验指令。这些陈旧的反模式不仅吞噬了宝贵的上下文窗口,更显著干扰了前沿模型内生的高维推理链路。通过自动化清理工具对提示词进行“脱水瘦身”,能在提升回答灵动性与准确率的同时,直接削减 20% 以上的冗余 Token 消耗。

    3. **按需精细化校准任务级 Effort(思考预算)**:针对不同认知复杂度的输入流水线,一律采用顶格思考预算属于严重的算力浪费。Anthropic 建议建立动态任务路由分发机制:对于确定性的数据抽取、格式转换与简单分类任务,果断将 Effort 压至最低;仅在涉及多步反思、复杂代码重构与对抗性逻辑推演时开放深度思考预算,从而实现全局成本与任务准确率的最佳帕累托最优。

  3. 2026-09-08OpenAI Official / Runway News

    多模态与端侧全量渗透:OpenAI 发布 ChatGPT Images 2.5 并在全量订阅梯队推送 Astra,Runway 推出 Adobe Premiere / After Effects 原生嵌入插件

    在数字创意与多模态生成赛道,前沿工具正在以前所未有的速度瓦解传统软件的孤岛界限,将机器生成从“外部预览玩具”进化为无缝嵌入工业级生产流的基础设施。

    OpenAI 官方正式发布了全新一代图像生成基座模型 ChatGPT Images 2.5。数据显示,目前全球用户每周通过 ChatGPT 图像功能与对应 API 累计创造超过 30 亿张视觉资产。相较于上一代 Images 2.0,新模型实现了端到端生成延迟降低最多 50% 的重大工程飞跃,极大压缩了创作者在灵感探索时的等待损耗。在视觉表现力上,Images 2.5 显著优化了微观纹理渲染、复杂自然光影追踪以及多主体空间纵深感,尤其在输入参考照片时表现出前所未有的主体面貌保真度与服装细节还原力。在交互体验上,产品端重磅引入了**手绘草图(Sketch)**功能,允许用户直接在对话窗口内涂鸦勾勒构图轮廓与色块分布,作为模型生成的强条件几何约束;同时支持在生成图片上进行**局部打点批注(Inline Commenting)**,实现针对特定图层的精细化局部重绘与语义修改。在开发者 API 层面,OpenAI 针对性推出了双模型矩阵:追求极速响应与轻量化开销的 `GPT-Image-2.5 Flare`,以及专为高精商业摄影、3D 纹理贴图设计、支持长耗时多轮推演的 `GPT-Image-2.5 Sunburst`。

    与视觉模型的推陈出新形成合力的,是桌面交互与专业影视后期生态的双向爆破。OpenAI 同步宣布,GPT-6 Astra 的全套桌面级自主交互与代码接管能力,现已正式向 Codex 以及 ChatGPT Work 体系内的 Plus、Pro、Business 和 Enterprise 全量付费用户全面推送解禁,标志着全自动桌面智能体从受限灰度测试正式走向千万级白领与工程人员的日常屏幕。

    而在影视特效与专业后期剪辑阵地,生成式视频先锋 Runway 正式推出原生桌面插件集 Runway Plugins,完成了对行业非线性编辑霸主 Adobe Premiere Pro 与 After Effects 的深层原生嵌入。过去创作者在剪辑流程中使用 AI 视频,必须被迫忍受“切出软件 -> 导出关键帧 -> 打开浏览器上传 -> 漫长排队等待生成 -> 下载高码率文件 -> 重新导入非编工程并在轨道上手动对齐位置”的碎片化地狱;如今通过嵌入面板,剪辑师可以直接在时间线播放头停留处输入提示词,调用后台新一代 Aleph 2 模型生成动态镜头并一键吸附至视频轨道。更具颠覆性的是其内置的 Edit Studio 模块:剪辑师只需选中时间轴上现有实拍素材并圈定锚点帧进行风格微调,模型便会自动以与原素材完全一致的帧率和精确时长重新渲染替换片段,配合一键 HDR 色彩映射与背景智能抠除,彻底终结了跨软件往返的摩擦损耗,吹响了生成式多模态全面重构专业影视工业流程的冲锋号角。

更新于 刊期:2026-09-09

订阅

只在有值得你注意的内容时发出,随时可退订。