04

2026-08-04日报

10 条精选5 组来源

AI 走向系统工程:模型、运行、评测、成本与控制同时上桌

8 月 4 日最值得注意的,并不只是一个 2.4 万亿参数的新模型。围绕模型运行的整套基础设施正在快速补齐:智能体需要可持续数天的工作环境,需要贴近真实代码库的评测,需要能看懂账单与资源消耗,也需要网络、数据和权限边界。模型能力仍然重要,但它只有进入一套可验证、可控制、可计费的系统,才会真正成为生产力。

几处容易被标题掩盖的差别尤其重要:Qwen3.8-Max 当天已经开放云端与 API,但开放权重仍在预告中;Data Commons 的公共图谱已经正式可用,私有数据实例则仍处预览;`@cloudflare/computer` 也还是早期项目。这意味着,判断一项更新的价值,必须同时查看可用状态、验证路径、权限设计与成本口径,而不能只看发布标题。

01

模型发布与更新

2 篇

  1. 2026-08-03Qwen

    Qwen3.8-Max 上线 QwenCloud,2.4T 参数;开放权重仍待后续

    Qwen 发布 Qwen3.8-Max,总参数量 2.4 万亿、每次推理激活约 950 亿参数,并先行通过 QwenCloud 与 API 提供服务。官方把重点放在编码、研究、办公和长周期智能体任务上,展示了连续 16 天维护命令行项目、5 天复现研究论文等案例,试图把模型竞争从一次性基准测试推向持续数天的真实工作。

    这些案例目前主要来自厂商自身,尚不能替代外部复现。更需要分清的是发布层级:截至 8 月 4 日,用户可以调用云端模型,但官方只预告将在下一周开放权重。因此,“模型已可用”和“权重已开源”不是同一件事,后者仍需等待正式仓库、许可证和社区测试。

  2. 2026-08-03SenseTime

    SenseNova U1.5-Lite-Preview 用 8B MoT 统一多模态理解、生成与编辑

    商汤开放 SenseNova U1.5-Lite-Preview,这是一款基于 8B Mixture-of-Transformers 架构的早期预览模型。它把图像理解、推理、生成和编辑放进同一套模型,支持最高 4K 输出,重点改善中文、日文和韩文文字生成、复杂排版、多图参考、风格迁移与局部修改等实际设计任务。

    官方给出的多项内部或公开基准成绩较上一版有所提升,模型权重也已经放到 Hugging Face,便于开发者自行验证。但“接近商业闭源模型”的表述仍是厂商判断,当前版本名称本身也明确标注 Preview;在稳定性、长提示一致性和商用工作流接入方面,仍应先用自己的素材做小规模测试。

02

产品发布与更新

5 篇

  1. 2026-08-03Cloudflare

    Cloudflare 推出 Billable Usage API,让云成本可以被程序直接读取

    Cloudflare 新增 Billable Usage API,为自助式账户提供统一的用量与费用查询入口,首批覆盖 Workers、R2、D1、Workers AI、Vectorize、Images 和 Stream。团队可以按产品与账期拉取数据,把成本归属、异常提醒和预算看板接入自己的系统;Vantage 也已基于该接口提供多云成本分析。

    这项能力对智能体时代尤其实际:当代理能够自动创建数据库、对象存储和计算资源时,费用也必须能被机器持续读取和约束。当前接口按日更新,并非实时账单;字段设计参考了 FOCUS,但 Cloudflare 明确表示尚未完全兼容该标准,企业账户支持和更细时间粒度也仍在路线图中。

  2. 2026-08-03OpenRouter

    OpenRouter 发布 Ori Eval,把选模型变成针对真实代码库的对照实验

    OpenRouter 推出的 Ori Eval 不再追求一张“所有场景通用”的排行榜,而是让多个模型在同一个代码库、同一项真实任务和同一套验收标准下完成工作,再由评审模型对结果进行比较。最终交付包括分数、理由、运行成本和建议选择,适合回答“哪个模型更适合这个仓库”而不是“哪个模型抽象地最强”。

    这种方法把模型选择拉回了具体业务,但实验设计仍决定结论是否可信:运行模型、评审模型、代码环境、任务说明和验收条件都应固定并记录。官方 Skill 预计一次评测需要约 10 至 30 分钟,也可能产生额外 API 费用;安装脚本和授权范围应先检查,不能把自动化评测当成无需监督的免费试用。

  3. 2026-08-03Cloudflare

    @cloudflare/computer 为智能体提供可持久化、可审计的“电脑”

    Cloudflare 开源早期预览项目 `@cloudflare/computer`,为每个智能体提供带虚拟文件系统、Git、Shell 和浏览器能力的独立工作空间。它优先在轻量隔离环境中运行 JavaScript 版命令,需要完整 Linux 能力时再切换到容器,并用同一份文件状态连接两种执行后端。

    真正值得关注的不是“代理也有一台电脑”这个比喻,而是持久化、同步、权限门控和操作审计被纳入同一抽象。Cloudflare 希望未来大多数任务无需启动容器,从而降低延迟和成本,但“少于 10% 的工作需要容器”目前更像设计目标;项目仍处早期预览,不应据此推断已具备生产稳定性。

  4. 2026-08-03Microsoft Research

    Microsoft Orchard 用统一环境连接智能体训练、评测与真实工具

    Microsoft Research 开源 Orchard,核心是可复用的 Orchard Env:研究者可以在 Kubernetes 环境中,用同一套基础设施训练和评测编码、GUI 操作、个人助理等智能体,并连接 Codex、OpenClaw、ZeroClaw 等真实工具框架。团队同时发布 Orchard-SWE、Orchard-GUI 和 Orchard-Claw,以及数据构造、强化学习和评测方法。

    官方报告显示,约 30 亿激活参数的 Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入价值重排序后达到 73.0%;其他小型模型也在 GUI 与个人助理任务中给出较强成绩。这些数字说明统一环境可能显著提高训练效率,但仍是研究团队发布的结果,能否迁移到不同仓库、工具链和预算,需要独立复现。

  5. 2026-08-03Google Cloud

    Google 将 Data Commons 建在 Spanner Graph 上,私有数据联邦进入预览

    Google 宣布基于 Spanner Graph 的 Data Commons 正式可用。公开知识图谱汇集 100 多个来源,包含超过 4,000 亿条观察值、26 亿条边和 17 亿个节点,并可通过 GQL、图遍历和一致性快照服务分析与 GraphRAG 应用。SDMX 3.0 的接入也让统计机构的数据更容易进入统一语义层。

    同时推出预览版 Data Commons Platform private instance,让组织在不复制原始私有数据的情况下,把内部数据与公共图谱联邦查询,并继续沿用原有访问控制。正式可用的是公共图谱底座,私有实例仍是预览;真正落地时,语义映射质量、权限继承和查询成本会比节点总量更关键。

03

行业动态

1 篇

  1. 规则自 2026-08-02 起适用欧盟委员会 · EUR-Lex

    欧盟《人工智能法案》第 50 条生效,交互与合成内容透明义务落地

    欧盟《人工智能法案》第 50 条自 8 月 2 日起适用。提供者需要在用户不易察觉时说明其正在与 AI 交互,并让生成或操纵的音频、图像、视频与文本具备机器可读标记;部署者还需对深度伪造、情绪识别、生物特征分类,以及未经人工编辑的公共利益 AI 文本履行相应披露义务。

    欧盟提供图标与自愿行为准则帮助统一做法,但法定义务本身不是自愿的,违规最高可面临 1,500 万欧元或全球年营业额 3% 的罚款。需要避免一个常见误读:延至 12 月 2 日的过渡安排只针对 8 月 2 日前已投放市场的生成式系统所承担的特定机器标记与检测义务,并不是所有第 50 条责任都获得四个月宽限。

04

论文研究

1 篇

  1. 2026-08-03Apple Machine Learning Research

    Apple 研究多模态偏好对齐,用偏差驱动采样寻找幻觉样本

    Apple 的研究分别考察偏好数据集、基础模型和对齐算法对多模态模型的影响,比较离线 DPO 与在线 DPO,并发现两者组合在部分场景下更有效。论文还提出 Bias-Driven Hallucination Sampling(BDHS),利用模型自身偏差构造容易出现视觉幻觉的训练样本,无需额外人工标注或外部教师模型。

    BDHS 在多个基准上表现出有竞争力的结果,说明对齐数据不一定只能靠昂贵标注扩充。但“有竞争力”不等于在所有任务上普遍领先;方法效果仍受基础模型、图像类型和评测集影响。更重要的贡献是提供了一种可分析的数据采样机制,让幻觉治理从结果打分进一步进入训练样本设计。

05

技巧与观点

1 篇

  1. 2026-08-03Google AI on DEV

    Google 公开 Agent Skills 的构建方法,但内部评测仍未随技能一起发布

    Google AI 介绍其 Agent Skills 仓库的生产流程:公开技能以 `SKILL.md` 为入口,可附带参考资料、脚本和资源;内部则额外维护负责人信息与 `EVAL.yaml`。团队通过自动检查控制元数据、目录结构、链接和文档长度,再用“启用技能”和“不启用技能”的多轮对照实验评估准确率与效率。

    这套流程值得借鉴的地方,是把技能视为需要负责人、持续集成和回归测试的软件资产,而不是一段写完即止的提示词。不过,内部导出到公开仓库时会移除所有权和评测文件,作者也确认专有评测不会公开;外部使用者因此无法直接复现官方效果声明,仍需为自己的任务建立可见测试集。

更新于 刊期:2026-08-04 · 第 4 期

订阅

只在有值得你注意的内容时发出,随时可退订。