Atlas News
RSS

01

2026-10-01日报

24 条精选22 组来源

Gemini 4 Argon 登场:代理能力、成本与监督同步升级

Gemini 4 Argon 带来新的前沿模型竞争,但真实任务成本、访问范围和输出可靠性,比单一榜单更能影响使用选择。与此同时,邮件代理、定时工程工作流和本地推理评测正在把 AI 推向持续执行的工具。

能力扩展也使监督与资源问题更加具体:已修复的网关漏洞、独立测试承诺、机器人经济性和长期算力合同,都提示部署决策需要同时考虑效果、权限与成本。

01

模型与访问

5 篇

  1. 2026-09-30Google DeepMind

    Gemini 4 Argon 发布,先向网络安全伙伴开放

    Google DeepMind 发布 Gemini 4 Argon,首先通过 Fairwind 项目向受信任的网络安全防御伙伴开放,之后再逐步扩展。官方公布的介绍期价格为每百万输入 token 2 美元、输出 token 10 美元,并支持百万 token 级输出。

    更长输出有望支撑大型代码修改和持续研究任务,但长输出与长上下文是不同能力。一般开发者、企业和消费者目前尚未全面获得访问权限,实际使用仍取决于后续开放安排。

  2. 2026-09-30Artificial Analysis / Arena

    Argon 外部评测:能力接近榜首,任务成本仍需细算

    Artificial Analysis 将 Argon 高推理档的智能指数评为 53,与 GPT-6 Astra 最高档持平;介绍期每项测试任务成本约 1.99 美元,标准价格下约为 3.98 美元。其平均每题输出约 6.2 万 token,明显高于 Astra 的约 2.7 万。

    在该机构知识测试中,Argon 幻觉率为 15%,但准确率为 50%,更多拒答是低幻觉率的重要背景。Arena 的另一组代理测试将其排在第八,显示不同任务和评测方式会给出不同结论。低单价并不自动意味着最低任务成本。

  3. 2026-09-30Arena

    GPT-6.1 Sol Max 登上 WebDev 榜第三

    Arena 公布 GPT-6.1 Sol Max 的 WebDev 结果:排名第三,分数 1759,较 GPT-6 Sol 高约 70 分;公布的混合 token 单价为每百万 8 美元。

    这为网页生成场景提供了新的外部比较依据。该结果反映 Arena 的网页任务和用户偏好,不能直接推算复杂项目的维护质量;混合单价也不同于某个项目的完整执行成本。

  4. 2026-09-30Vercel AI Gateway

    Ling 3.1 Flash 出现在托管 API,免费价格有期限

    Vercel AI Gateway 已列出 InclusionAI 的 Ling 3.1 Flash 免费路由,面向编程、多步分析和工具调用。平台介绍为 5600 亿总参数、250 亿激活参数,当前供应商路由提供约 26.2 万 token 上下文、最多 32768 token 输出。

    开发者可以通过统一 API 进行任务对比,但该路由的免费促销截至 10 月 13 日。使用额度、供应商条款和实际服务上限仍适用,不能把模型宣传中的长上下文能力直接视作所有托管端点的配置。

  5. 2026-09-30Arena

    Sonnet 5.5 开放限时直接试用

    Arena 将 Claude Sonnet 5.5 High 加入 Direct Mode,用户可以直接选择模型试用,窗口截至 10 月 2 日太平洋时间上午 8 点。此后仍会保留 Battle 和 Agent Mode 的访问。

    对于正在比较模型的用户,直接选择比随机对战更方便复测自己的提示词。这是 Arena 的限时访问安排,不能据此判断 Anthropic API 的权限或价格。

02

产品与工作流

2 篇

  1. 2026-09-30Perplexity

    Perplexity Computer 邮件入口扩大开放

    Perplexity CEO Arav Srinivas 宣布,Computer 的邮件入口向所有人开放,无需账户,并在限时期间免费。用户可将邮件转发给或抄送 [email protected],让代理在后台处理任务并延续邮件上下文。

    邮件由此成为无需切换应用的任务入口,适合从已有往来中发起研究或整理工作。免费期限尚未明确,能处理什么任务仍取决于提供的上下文与服务能力。

  2. 2026-09-30Factory

    Factory Automations 正式开放,重复工程任务可定时运行

    Factory 向所有用户正式开放 Automations,可用自然语言描述工作流,通过时间表、Slack、GitHub 或 webhook 触发 Droid。模板覆盖工单到 PR、代码审查、CI 排查、安全检查和工作摘要。

    每个自动化可以单独配置模型、推理档位和运行机器,并以用户或服务账户身份执行。运行记录和可检查的会话有助于追踪结果;自动生成修改和提交 PR 仍需要团队既有的审查流程。

03

开发与基础设施

6 篇

  1. 2026-09-30DeepSeek

    DeepSeek 为昇腾发布专用推理算子与通信库

    DeepSeek 的官方仓库公开 DeepGEMM-Ascend 和 DeepEP-Ascend:前者提供矩阵计算与 MoE 相关算子,后者处理专家并行的分发与合并。项目沿用与既有 GPU 库接近的接口,当前验证环境指向昇腾 950。

    这有助于降低模型服务迁移的接口改造成本,但接口兼容不代表所有硬件和功能已经齐备。DeepEP-Ascend仍将流水线、上下文和数据并行等能力标为开发中,部署还需匹配 CANN 与驱动环境。

  2. 2026-09-29Artificial Analysis

    AA-AgentPerf-Local 用真实代理轨迹比较本地推理速度

    Artificial Analysis 发布 AA-AgentPerf-Local,重放八项真实任务、168 轮交互,比较不同本地硬件上的代理推理表现。测试涵盖 DGX Spark、Ryzen AI Halo、M5 Pro 和 RTX 5090 等设备,平均上下文约 5.6 万 token。

    固定轨迹能减少任务选择差异,适合评估本地代理的延迟与硬件适配。它测量的是推理性能,并不重新判断模型是否正确完成任务,不能用速度结果替代能力评测。

  3. 2026-09-29vLLM

    vLLM 拆分预填充与解码,强调实际服务负载

    vLLM 发布分离式服务指南,将预填充和解码交给不同资源,并介绍 CPU 侧输入渲染与输出处理的拆分方式。不同阶段的计算和内存需求可以分别调节,减少长输入对持续生成的干扰。

    收益主要应看满足延迟目标的有效吞吐量。KV 缓存传输、网络带宽和运维复杂度可能抵消收益,因此需要用真实请求长度和并发量测试,而不是默认拆分后总吞吐必然提高。

  4. 2026-09-30OpenRouter

    代理更换模型或提示词前,先建立回归检查

    OpenRouter 发布代理回归测试指南,建议固定代表性案例,并为预期行为、工具使用和可接受结果写出明确约定。模型、提示词、检索或工具发生变化时,都应重新运行同一批测试。

    只比较最终文本容易漏掉中间步骤的退化。将工具轨迹、失败类型和上线阈值纳入检查,能帮助团队发现“回答看起来正常、执行已经变差”的情况。

  5. 2026-09-30OpenRouter

    把生产流量转成可维护的黄金评测集

    OpenRouter 的新教程从真实生产请求出发,介绍抽样、相似案例去重、人工审核和评分标准设计,再把样本版本化为可反复运行的评测集。

    高频请求之外,也应保留少见但代价高的失败案例。黄金集的价值来自清晰的预期与持续维护;未经审核的大量日志,并不会自动成为可靠的模型质量标准。

  6. 2026-09-30OpenRouter

    工具调用准确率要拆开测:选工具与填参数

    OpenRouter 发布工具调用测试指南,将正确选择工具与正确填写参数区分开来。检查范围包括必填字段、参数值、结构化输出以及工具接口变化后的兼容性。

    团队可先用确定性替身验证调用契约,再通过集成测试检查真实执行结果。这比仅统计调用次数更能暴露错误,也避免把格式正确误当作业务操作正确。

04

研究与实体世界

3 篇

  1. 2026-09-30Google DeepMind

    SynthID Bio 为蛋白质设计加入可追踪水印

    Google DeepMind 介绍 SynthID Bio,可在氨基酸序列或预测三维结构中嵌入水印,并尝试在实际合成的蛋白质中检验来源标记。针对 VEGF-A、SARS-CoV-2 刺突 RBD 和 PD-L1 的结合蛋白实验,团队报告水印组与对照组在命中率、亲和力和多样性上相近。

    这为生成式生物设计提供来源追踪思路,但三个靶点的结果不能证明所有蛋白质都能无损加水印。来源标记也不能单独判断生物设计是否安全,仍需配合其他筛查。

  2. 2026-09-30Anthropic

    机器人能做多少工作?技术可行与经济可行差距很大

    Anthropic 分析约 1.9 万项职业任务,以模型评估机器人在不同环境中的能力,估计其技术可覆盖约 74% 的体力任务、对应约 34% 的工作时间。但按当前成本,具有价格竞争力的任务仅占全部工作约 0.3%。

    这份研究衡量的是任务暴露,不是已被替代的岗位,且大量能力依赖较结构化的环境。文中基于持续降价的长期推演是条件情景,不能当作机器人将在某个年份大规模取代劳动的确定预测。

  3. 2026-09-30MIT

    Ataraxos 在隐藏信息棋局中击败顶尖人类

    MIT、卡内基梅隆、纽约大学和斯坦福的研究者开发 Ataraxos,在 Stratego 中显著击败顶尖人类玩家,并在其他策略游戏中表现出泛化能力。研究发表于 Nature,将高效训练与针对隐藏信息的决策方法结合。

    这类问题需要同时处理未知状态与对手反应,比完全可见的棋局更接近谈判和安全博弈。但游戏表现尚不能直接证明系统适用于真实军事或商业决策,解释性和人类监督仍是实际应用的关键。

05

安全与治理

5 篇

  1. 2026-09-30OpenAI

    OpenAI 披露并处置协同模型蒸馏活动

    OpenAI 披露一起协同模型蒸馏活动:7 月 24—25 日的峰值超过 1.6 万次尝试,涉及逾 4000 名用户;7 月 28 日处置的更大关联集群涉及逾 1.5 万名用户。活动利用跨用户、工作区与模型重放加密推理内容等方式,尝试诱导受保护的推理输出。

    OpenAI 表示,这不涉及破解加密、入侵数据库或直接访问存储的用户聊天。“尝试次数”也不等于成功提取次数。事件显示,保护模型能力还需要跨账户识别协同行为,而不只是约束单次请求。

  2. 2026-09-30PromptArmor

    已修复的 Copilot Cowork 漏洞暴露网关权限缺口

    PromptArmor 披露,恶意 Skill 可借助 Copilot Cowork 允许访问的 AI 网关,在主代理之外调用带网络工具的代理,外传可访问的用户文件。研究者于 7 月 14 日报告问题,微软于 8 月确认,并在 9 月 2 日完成修复。

    这一案例说明,沙箱允许的外部服务也可能成为数据传输通道,需要同时约束工具内容与网关能力。它是已经修复的问题披露,不能据此认定当前版本仍可通过相同方式被利用。

  3. 2026-09-30METR

    METR 在参议院说明代理监督为何越来越困难

    METR 主席 Chris Painter 于 9 月 30 日在美国参议院听证会上作证,讨论自主代理事件及其行业背景。他指出,数千代理产生的操作量超过人工逐项审查能力,自动监控虽然必要,也可能被误导或绕过。

    证词呼吁更透明地分享前沿能力、事件和缓解措施。METR 对相关事件的调查范围有限,并非全面安全审计;其机构明确不采取政策立场,因此不宜把证词概括成对某项监管方案的背书。

  4. 2026-09-30Ars Technica / NVIDIA

    白宫推动 AI 安全自愿协议,独立测试细节仍待明确

    据 Ars Technica 报道,约两打科技公司签署白宫推动的自愿安全协议,承诺内部监控、独立安全审查及共同讨论标准。英伟达 CEO 黄仁勋也公开介绍了协议方向。

    评估重点包括网络、生物、化学风险和模型未经授权的行为。目前协议没有新增法律义务,审查机构、执行方式与公开程度仍不充分明确,承诺本身不能替代可验证的实施结果。

  5. 2026-09-30The Decoder / New York Post

    报道:FTC 准备调查前沿模型的消费者保护问题

    The Decoder 援引 New York Post 报道称,美国 FTC 准备对 OpenAI、Anthropic 等前沿模型企业展开消费者保护调查,并计划在未来数周发出民事调查要求。报道关注企业安全承诺与实际风险之间是否存在差距。

    目前信息来自媒体引述的政府消息人士,尚不能视作已公开的正式调查文件或违法认定。对企业用户而言,安全声明是否具有可验证依据,将越来越影响供应商评估。

06

商业与资源

3 篇

  1. 2026-09-30IT之家 / Reuters

    Anthropic 与 SpaceX 算力协议上限达 845 亿美元

    IT之家援引路透社查阅的 IPO 文件报道,Anthropic 与 SpaceX 的算力协议到 2029 年潜在付款最高达 845 亿美元。报道同时指出,大部分相关协议可提前 90 天通知解除,无需承担解约罚金。

    这一规模显示前沿模型服务对长期算力的依赖,但付款上限不同于确定的支出义务或供应商已实现收入。评估算力合同需要同时看期限、取消权和实际交付。

  2. 2026-09-29GamersNexus

    长期内存供货协议增加,本地 AI 硬件成本承压

    GamersNexus 的分析梳理内存厂商长期供货协议和消费级 RAM、SSD 价格。文中样本显示,32GB DDR5 套装均价同比上涨约 363%,2TB NVMe SSD 上涨约 137%;厂商正把更多供给锁定给长期大客户。

    这会抬高本地推理、开发工作站和小型服务器的采购门槛。涨幅来自指定产品样本,不能代表所有市场和规格;长期协议也未被证明可以彻底消除内存行业周期。

  3. 2026-09-30ElevenLabs

    ElevenLabs 员工股份交易估值达 220 亿美元

    ElevenLabs 宣布完成 3 亿美元员工股份出售交易,公司估值达到 220 亿美元,较 2 月翻倍。Wellington 与 T. Rowe Price 领投,公司称企业业务占收入 55%,ElevenAgents 每周处理超过 1500 万次对话。

    交易主要为员工提供股份流动性,不能等同于公司获得 3 亿美元新增运营资金。业务规模数据由公司披露,也显示语音产品正在从内容生成延伸到客户服务与企业操作。

更新于 刊期:2026-10-01

订阅

只在有值得你注意的内容时发出,随时可退订。