28

2026-08-28日报

25 条精选5 组来源

可控生成、可审计智能体与可信评估:AI 从能力竞赛进入基础设施治理

今天的主线不是单一模型再刷一次榜单,而是生成能力、智能体基础设施和可信治理同时向前推进。Google 为视频生成加入可连续延展、首尾帧插值和更低成本预览,Midjourney 开放新一代图像编辑模型测试;Anthropic 则把模型控制实验设备所需的接口抽象成研究预览,并为科研人员提供更大范围的产品席位和项目额度。

工程侧的变化更具长期影响:Databricks 将 Postgres 的事务日志、对象存储与分支机制重新组合,以适应大量短生命周期智能体任务;Claude Code 增加受限运行模式,GitHub 调整审查、留存与社区治理能力。与此同时,多起供应链与提示注入事件提醒我们:智能体越能自主行动,隔离、凭证边界、责任归属和可复核评估就越需要成为默认设计。

01

生成模型、科研工具与新型计算

5 篇

  1. 2026-08-27Google DeepMind

    Google 推出 Gemini Omni 1.1 Flash:视频可分段延展至 40 秒,并加入首尾帧插值

    Gemini Omni 1.1 Flash 将视频生成重点放在“连续可控”上:创作者可以每次增加 10 秒,并以前一段最多 10 秒作为上下文,将片段延展到 40 秒;首帧与尾帧插值则让镜头从指定起点过渡到指定终点。模型还支持更高分辨率输出,以及用多张参考图控制人物、物体和视觉风格。

    Google 表示,360p 预览相较 720p 可将生成速度提高最多 60%,成本约为后者的三分之一,适合先快速试错、再升级到 1080p 或 4K。这里的关键不只是画质,而是把长镜头拆成可以迭代和校正的制作流程;实际连贯性仍需在复杂运动、角色一致性和多段延展中检验。

  2. 2026-08-27Midjourney Updates

    Midjourney 开放 V8.2 图像编辑模型测试:最多组合四张参考图

    Midjourney 面向所有用户开放首轮 V8.2 图像编辑模型测试。新模型支持自然语言局部修改、扩图与补绘,并可同时使用最多四张参考图;个性化设置、情绪板和风格参考也能参与编辑,而不只用于从零生成。

    这让工作流从“一次生成一张新图”转向“围绕现有素材持续修改”。Midjourney 明确将其定位为早期测试,边缘区域、复杂遮挡、精确文字和多参考图冲突仍可能出现不稳定结果,因此更适合作为创意迭代工具,而不是无需复核的成品编辑器。

  3. 2026-08-27Anthropic

    Anthropic 发布 Model Hardware Standard 研究预览:用统一原语连接模型与实验设备

    Anthropic 发布 Model Hardware Standard 研究预览,尝试为机器人、实验仪器和其他可编程物理设备建立一套与模型无关的接口。标准把设备能力描述为驱动、原语和标签,使模型可以通过 MCP、命令行或代码调用同一套硬件功能,而不必为每台设备重新编写专用集成。

    合作方报告称,部分集成工作可从数周或数月缩短到数小时或数分钟,但这仍是研究预览,并未开源成为成熟行业标准。物理设备具有真实安全后果,校准、权限、急停和专家监督不能被接口统一所替代;真正价值要看后续的互操作测试、安全规范和生态采用。

  4. 2026-08-27NVIDIA

    NVIDIA Vera CPU 开始规模交付,面向智能体编排与高带宽数据处理

    NVIDIA 宣布 Vera CPU 已开始规模交付,并首先进入 AWS 基础设施。Vera 配备 88 个 Olympus 核心和每秒 1.2TB 的内存带宽,目标工作负载包括智能体编排、工具调用、沙箱执行、数据预处理,以及为加速器持续供给上下文的 CPU 密集型环节。

    NVIDIA 称,Vera 在部分智能体 AI 工作负载上可实现最高每核 1.8 倍性能提升;这是厂商测试结果,仍需结合软件栈、内存容量、功耗和端到端系统成本评估。它释放的信号很明确:智能体系统的瓶颈不只在 GPU,调度、序列化、检索和隔离同样会把 CPU 推回基础设施设计中心。

  5. 2026-08-27Anthropic

    Anthropic 扩大科研支持:提供一万份一年期席位与单项目最高 5 万美元额度

    Anthropic 宣布向高校与非营利机构的首席研究员或同等负责人提供一万份一年期产品席位:标准席位免费,高级席位以每月 15 美元提供约五倍使用量。其 AI for Science 计划还将为入选项目提供最高 5 万美元的 API 额度。

    计划意在降低文献分析、代码、实验设计和研究协作的使用门槛,但并未取消生物与化学领域现有的模型限制。免费席位和算力额度可以加快探索,却不能替代数据治理、可重复实验、学术署名和领域专家审查。

02

智能体基础设施与开发者平台

6 篇

  1. 2026-08-27Databricks

    Databricks 详解 Lakebase:以 WAL 为事务真相,用对象存储承载完整历史

    Databricks 公布 Lakebase 的 Postgres 存储架构:提交先进入复制的预写日志(WAL),对象存储保存可追加的持久历史,而计算节点与持久数据解耦。查询并不直接读取对象存储;系统通过日志与缓存重建可服务的数据库状态,以保留事务语义。

    分支本质上是指向特定日志序列号的轻量指针,并通过写时复制产生差异。Databricks 展示了为 2TB 数据库在数秒内创建分支、按任务隔离智能体写入,以及即时恢复和时间旅行等能力。它特别适合大量短命实验环境,但生产采用仍需衡量恢复时延、缓存预热、跨区容灾和成本曲线。

  2. 2026-08-27Anthropic Claude Code Release Notes

    Claude Code 2.1.248 增加受限模式,默认移除命令执行与网络抓取

    Claude Code 2.1.248 新增受限运行模式。启用后,命令执行、代码执行和 WebFetch 默认不可用,除非被明确加入允许范围;文件工具被限制在当前工作目录内,系统拒绝绕过权限模式,并忽略用户级、项目级和本地设置。

    这一模式为代码审查、陌生仓库检查和低信任任务提供了更清晰的默认边界。版本同时加入跨会话消息,并修复多项稳定性与隐私问题,包括防止敏感文件被云端会话或相关审查流程上传。受限模式仍不是操作系统级隔离,高风险输入仍应配合容器、虚拟机和最小化凭证。

  3. 2026-08-27GitHub Changelog

    GitHub Actions 将检查、工作流运行与状态统一纳入留存策略

    GitHub 宣布从 2026 年 10 月 1 日起,Checks、工作流运行和提交状态将统一遵循 Actions 留存设置。默认留存期为 90 天;公共仓库的可配置上限也是 90 天,取代部分记录过去可能保留 400 天以上的做法。

    变更不追溯删除已经存在的历史记录,但之后的数据会按新策略到期。依赖长期 CI 证据做审计、合规或发布追踪的团队,需要提前把关键日志、制品元数据和状态记录导出到自己的归档系统,而不是把代码托管平台当永久审计仓库。

  4. 2026-08-27Micah Lee

    一套代码智能体隔离实践:单仓库沙箱与专用签名密钥分离权限

    安全研究者 Micah Lee 公开了自己的代码智能体隔离方案:每个智能体只进入单一 GitHub 仓库的沙箱,并使用专门的智能体身份提交代码。专用 SSH 密钥只用于签名而非身份认证,避免沙箱继承用户可以访问全部仓库的主凭证。

    文章还通过独立 SSH agent 与 Docker Sandboxes 转发受限密钥,明确区分“提交可归因”和“获得远程仓库访问权”。这是一套个人实践而非通用安全认证,但它抓住了关键原则:目录限制、网络与进程隔离、凭证最小化和人机身份标记必须分别落实,不能只靠一张工具允许表。

  5. 2026-08-27GitHub Changelog

    GitHub Copilot 代码审查覆盖机器人与超大 PR,并加入解决原因

    GitHub 扩大 Copilot code review 的覆盖范围:在组织策略允许时,它可以审查机器人创建的拉取请求,并对 Copilot cloud agent 创建的 PR 进行完整智能体审查;此前 300 个文件或 2 万行代码的固定规模限制也被移除。

    开发者在关闭 Copilot 审查意见时,现在可以选择“已处理”“不修复”或“判断错误”。这既为团队保留决策上下文,也为产品提供反馈信号。不过,能处理更大的变更不等于大型 PR 更容易审查;拆分改动、运行测试和保留人工责任仍是降低风险的主要手段。

  6. 2026-08-27GitHub Changelog

    GitHub 可在屏蔽用户时关闭其全部未结贡献

    GitHub 在个人账号和组织的屏蔽对话框中加入“关闭该用户创建的内容”选项。管理员可一次关闭被屏蔽用户仍处于开放状态的 Issue、Discussion 和 Pull Request,而无需逐项处理。

    这能降低垃圾信息、骚扰和恶意贡献造成的维护负担,但批量关闭同时扩大了误操作影响。组织应结合屏蔽原因、私有备注和复核流程使用,避免把正常争议或尚有价值的贡献在没有记录的情况下全部清除。

03

安全、责任与开放生态治理

7 篇

  1. 2026-08-27Google DeepMind

    Google 试行全球首批双盲模型评估:双方都看不到对方的敏感材料

    Google DeepMind 与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 试行双盲模型评估。评估方看不到模型权重,模型提供方也看不到保密测试提示;双方通过 Confidential Space 等加密与受控计算机制完成推理和结果交换。

    试点使用 Gemini Flash Lite,目标是降低测试集泄露、训练数据污染和针对基准调优的风险,同时保护模型知识产权。双盲并不会自动保证题目质量或消除评估偏差,但它为独立机构测试闭源模型提供了比“交出权重”或“公开题库”更可行的中间路径。

  2. 2026-08-27Ars Technica

    一项集体诉讼指控 xAI 训练数据涉及儿童性虐待材料

    一份拟议集体诉讼称,xAI 用于训练 Grok 的数据集中包含原告已知的儿童性虐待材料,并质疑其条款是否充分排除了此类内容、未经同意的私密影像和其他高风险数据。报道所述内容来自原告指控,不是法院已经确认的事实。

    案件把训练数据治理的核心问题再次推到台前:来源追踪、非法内容拦截、受害者通知、删除请求和模型再训练责任,都不能只靠宽泛的服务条款处理。后续应以法院文件、xAI 的正式回应和可验证的数据治理证据为准。

  3. 2026-08-27KrebsOnSecurity

    澳大利亚拘捕两名被指关联 TeamPCP 的嫌疑人,供应链攻击仍在追查

    KrebsOnSecurity 报道,澳大利亚联邦警察拘捕两名分别 21 岁和 23 岁的西澳男子,指控他们与 TeamPCP 相关的恶意开源软件活动有关。报道将该组织与 Shai-Hulud 攻击以及 LiteLLM 供应链入侵联系起来;这些关联和涉案行为仍属于调查与指控阶段。

    事件说明,攻击者盯上的不只是单个软件包,而是维护者账号、发布令牌和开发者信任链。使用智能体自动安装依赖或执行仓库脚本的团队,应锁定版本、验证发布来源、隔离构建环境,并为包注册表和云端密钥设置可快速轮换的最小权限。

  4. 2026-08-27Simon Willison

    研究者报告 Claude Code 自动模式提示注入链,关键在本地模块劫持

    Simon Willison 转述安全研究者 Johann Rehberger 的测试:恶意压缩包可诱导 Claude Code Opus 5 自动模式解压并运行代码,随后利用当前目录中的恶意 struct.py 覆盖 Python 标准库同名模块。研究者称,该组合攻击在其测试中约有 80% 成功率。

    这一结果属于特定环境与提示下的研究者报告,不能直接外推到所有部署。它揭示的工程问题却很普遍:即使智能体没有显式执行危险命令,解压位置、工作目录、模块搜索路径和隐式导入也可能形成执行链;陌生文件应在无凭证、无外网和一次性沙箱中处理。

  5. 2026-08-27Joan Westenberg

    “责任漂白”:把决策交给模型,并不会消除管理者的责任

    Joan Westenberg 将一种组织现象称为“责任漂白”:管理者把招聘、风控、绩效或客户决策交给模型,再用“系统建议”弱化自己的选择和责任。算法输出因此可能成为一层看似客观、实则遮蔽价值判断与权力关系的外壳。

    这是一篇观点文章,不是实证审计。它提供的实用提醒是:组织应记录谁选择了模型、谁批准了规则、谁有权推翻输出,以及受影响的人如何申诉。披露使用模型只是起点,最终责任仍应落到可识别、可问责的人和制度上。

  6. 2026-08-27Lectronz

    欧洲包装合规成本引发小型创客担忧

    开源硬件市场 Lectronz 的运营者撰文称,欧洲各国包装注册、费用和申报流程叠加后,对单人创客与微型卖家形成了不成比例的固定成本。对于销售量很小、跨境订单分散的项目,每个国家分别合规可能让继续发货失去经济可行性。

    这是平台经营者的立场与案例观察,并非对欧洲全部规则的系统影响评估。它值得 AI 硬件和开源设备社区关注,因为模型能力最终要通过传感器、开发板和小批量实验设备落地;政策若缺乏按规模分层的合规路径,创新成本会先落到最小的供应者身上。

  7. 2026-08-27GitHub Blog

    OpenClaw 维护者复盘爆红后的安全与治理压力

    GitHub 采访了 OpenClaw 的维护团队。截至 8 月 26 日,该项目约有 38.8 万颗 Star、8.1 万次 Fork 和超过 8 万次提交;快速增长带来了海量 AI 辅助贡献、依赖关系扩张、冒名与声誉攻击,以及安全默认值需要持续收紧等问题。

    维护者强调,自动生成代码并没有降低信任管理成本,反而需要更清晰的贡献者身份、审查记录、发布权限和依赖所有权。OpenClaw 的经历表明,开源项目的“规模”不能只看 Star 或提交量,真正承载安全的是少数维护者的时间、制度与可恢复流程。

04

研究、评测与模型行为

5 篇

  1. 2026-08-27LMSYS Org

    SGLang 公布 MiniMax-H3 视频生成优化:无损路径最高约 1.95 倍加速

    SGLang 团队公布 MiniMax-H3 在 8 张 NVIDIA H200 上的视频生成优化结果。测试采用 1344×768 分辨率、24 帧率和 50 个采样步骤;密集、无损的执行路径相对 Diffusers 基线实现约 1.85 至 1.95 倍加速。

    加入缓存与稀疏计算后,最高加速达到 6.24 倍,但会以 SSIM 约 0.76 至 0.91 的画面相似度为代价。数据提供了可复现的工程参考,却不是所有分辨率、镜头长度和硬件上的通用结论;生产团队需要在延迟、吞吐和视觉偏差之间自行选点。

  2. 2026-08-27Google Research

    Google Planetary Prediction Engine 用自然语言编排全球地理预测流程

    Google Research 介绍 Planetary Prediction Engine:研究者用自然语言描述问题后,系统可自动完成地理空间数据检索、特征构建、模型训练、评估和报告生成。团队称,它能把部分原本需要数周的全球建模流程缩短到分钟级。

    演示覆盖多类地球观测基准,并强调在没有人工逐步编排的情况下完成端到端任务。自动化能降低使用遥感与地理数据的门槛,但结果仍依赖数据覆盖、标签质量、空间泄漏控制和领域验证;对气候、灾害或公共政策的高风险判断不应跳过专家复核。

  3. 2026-08-27OpenAI

    千人课堂实验:ChatGPT 与因果推理训练带来不同且互补的收益

    OpenAI 与博科尼大学研究者在超过一千名一年级学生中开展随机课堂实验,按课时分配 ChatGPT、因果推理训练、两者结合或对照条件。研究报告称,使用 ChatGPT 的作业在人类评分的五分制量表上平均提高接近一分,而因果推理训练更明显地提升了观点的原创性和多样性。

    两种干预一起使用时呈现互补效果:工具帮助扩展和组织内容,方法训练帮助学生提出不同问题。研究发生在特定课程和评分体系中,量表也可能低估原创性,因此它支持的是“工具加思维训练”的教学设计,而不是对所有学习场景的普遍因果结论。

  4. 2026-08-27Giles Thomas

    GPT-2 微调实验:Dropout 没有解释官方权重为何更容易迁移

    Giles Thomas 在复现 GPT-2 的系列实验中比较了开启与关闭 Dropout 的预训练和微调组合。实验显示,加入 Dropout 往往需要更多轮次才能收敛;对原本没有用 Dropout 预训练的模型,微调时临时加入它通常伤害更明显。

    即便预训练阶段使用了 Dropout,多数组合也没有稳定获得更好迁移效果。因此作者判断,Dropout 不能解释官方 GPT-2 权重为何优于自己的复现权重。它是一次边界清楚的个人实验,价值在于提醒复现者匹配预训练条件,而不是把单个正则化选择当作万能答案。

  5. 2026-08-27Louis Abraham

    一项文本分析追踪 Claude 的“承重词汇”,写作模式随时间显著集中

    Louis Abraham 对 Claude 生成的拉取请求描述进行聚类,归纳出八类反复出现的写作模式。作者观察到,其中一种模式从 2025 年初约 1% 上升到 2026 年中约 45%,显示模型输出的措辞和结构可能随着训练、偏好优化与产品模板逐渐集中。

    这项分析具有探索性,样本来源和聚类方法都会影响结果,不能据此可靠判断任意文本是否由 Claude 生成。它更值得关注的地方,是模型风格可能成为产品层面的隐性默认值;当大量内容通过同一系统生成时,表达多样性也应成为可测量的质量指标。

05

采用规模与区域市场

2 篇

  1. 2026-08-27IT之家 / 央视财经

    报道称中国日均词元调用量已突破 500 万亿

    据 IT之家转引央视财经报道,截至 2026 年 6 月,中国日均词元调用量已突破 500 万亿。报道还援引行业人士称,头部模型的更新节奏从约三个月缩短到四至六周,竞争重心正由单纯模型能力转向智能体落地和生态建设。

    腾讯方面称,混元 3 正式版上线首周的词元调用量是上一代模型的 68 倍。调用量不是独立的模型质量指标,也可能受到统计口径、缓存与内部流量影响;它更适合被理解为推理基础设施需求快速扩张的信号。

  2. 2026-08-27OpenAI

    OpenAI 在巴西建立本地商业团队,称当地每日消息量约 2.15 亿条

    OpenAI 宣布在圣保罗建立本地商业运营团队。公司称,巴西已是 ChatGPT 每周活跃规模最大的三个市场之一,用户每天发送约 2.15 亿条消息,过去一年接近翻倍;巴西 API 开发者数量位居全球第二,Codex 周活跃使用量自 1 月以来增长约 11 倍。

    OpenAI 还引用由其资助的 RegLab 研究,估算生成式 AI 到 2030 年可能为巴西带来 1 万亿雷亚尔经济价值。采用数据展示了本地化服务的商业理由,但经济影响预测应结合资助关系、方法假设、劳动市场分配与独立研究一并阅读。

更新于 刊期:2026-08-28

订阅

只在有值得你注意的内容时发出,随时可退订。