每日 AI 新闻简报(2026-10-05)

聚焦技术进展与商业动态,按重要性排序的今日 AI 行业热点。

1. MIT 何恺明团队 VISTA 视觉框架让 Claude Opus 5.0 在 ARC-AGI-3 取得满分 100

摘要:10 月 1 日 MIT 何恺明团队在 arXiv 发表论文(arXiv:2610.02200)提出 VISTA 视觉交互框架,让通用大模型通过原始截图感知环境并保留无损视觉记忆;该框架使 Claude Opus 5.0 在 ARC-AGI-3 上的相对人类行动效率得分从 40.68 跃升至满分 100.00,并以比首次试玩人类少 57.4% 的动作通关全部 25 个公开游戏 183 关,GPT-5.6 Sol 在同一框架下得分 98.27,证明多模态模型此前在 AGI 测试上表现不佳的核心瓶颈在于”看不清”而非”想不通”,重新定义了智能体感知能力的优化方向。

信息来源:arXiv:2610.02200 / VISTA GitHub

2. JetBrains 发布 Air 系统,重构智能体开发工作流

摘要:10 月 1 日 JetBrains 正式发布 Air 系统,定位为”用智能体构建软件的统一系统”而非 IDE 插件,包含 Air in IDEs(多智能体并行协作)、Air Teams(共享云端工作空间)、Air Governance(预算与审计治理)三大组件;同时联合 Zed 推出开放标准 Agent Client Protocol (ACP),基于 JSON-RPC 2.0,已有 Claude、Codex、Gemini CLI 等 25 个智能体接入,并同步发布 Junie CLI 与可完全本地运行的 Junie Local,标志着主流 IDE 厂商全面押注智能体原生开发范式。

信息来源:JetBrains Blog

3. SoftBank 完成 OpenAI 最后一期 100 亿美元注资,累计投资达 646 亿美元

摘要:10 月 1 日(日本时间)SoftBank 执行了对 OpenAI 的最后一期 100 亿美元注资,正式完成今年 2 月 27 日约定的 300 亿美元追加投资承诺;自此 SoftBank 累计对 OpenAI 投资达到 646 亿美元,持股比例约 13%,成为迄今单一机构对 AI 公司最大规模的资本押注,为 OpenAI 持续研发下一代前沿模型与扩展企业商业化提供充足弹药。

信息来源:vibecoding.ru / NeoTeo

4. Meta 开源 Muse Glimmer 30B 多模态模型,押注本地智能体赛道

摘要:Meta 在 Hugging Face Transformers v5.15.0 中以 Apache 2.0 协议开源 Muse Glimmer,这是一个 300 亿参数的多模态模型(2B 视觉编码器 + 28B 文本解码器),可在单张高端 GPU 或高配工作站上运行,面向隐私敏感的本地智能体场景如编码助手、文档分析与个人助理;同期 Transformers 还集成了 IBM GraniteSWA/GraniteMoeSWA 滑窗架构及 A.X-K1/K2 模型,是本季集成度最高的开源版本,标志着 Meta 在云端 Muse 之外开始补全”端侧个人超级智能”的拼图。

信息来源:Muse Glimmer on Hugging Face

5. Amazon 封锁 Muse 购物,Meta 智能体战争进入平台争夺阶段

摘要:在 Meta Connect 2026 上,Meta 公布 Muse 智能体新阶段:新版 Mac 应用可直接驱动用户电脑、引入可视化形象交互模型、并计划成为其智能眼镜上的主代理,底层模型升级为 Muse Spark 1.3;与此同时扎克伯格在台上确认 Amazon 已封锁 Muse 在其站点的购物功能,Meta 则通过接入 Stripe、Shopify Shop Pay 与扩展 PayPal 支持构建自有支付通路,并考虑对完成的交易收取少量费用,智能体竞争焦点已从”哪个模型回答更好”转向”谁的智能体能跑通更多业务”,平台方开始选择是开门欢迎还是关门防守。

信息来源:Mashable / Meta AI Blog

6. Anthropic 推出 build-eval 与 hillclimb,将评测设计变成可复用技能

摘要:Anthropic 发布 claude-api 的 build-eval 与 hillclimb 两个命令技能,前者帮助在改动应用前先构建评测集,后者基于该评测集驱动改进循环;技能将评测拆解为输入、runner、scorer 三部分并要求”任何能用代码验证的都必须通过代码检查”,强调质量、成本、延迟要分别记录,把过去依赖感觉的 prompt 调优变成可记录、可回滚的实验,推动 LLM 应用开发流程走向工程化与可审计化。

信息来源:Automating eval design and hillclimbing

7. PaleBlueDot AI 完成 2 亿美元 C 轮融资,估值 32 亿美元

摘要:10 月 1 日 PaleBlueDot AI 宣布完成 2 亿美元 C 轮融资,估值达 32 亿美元,由 ComputeCore、B Capital 等全球投资者领投,累计股权融资已超 3.6 亿美元;同期 Luxembourg 的混合风险情报公司 Osavul 完成 850 万欧元 A 轮融资用于扩展政府、国防与关键基础设施 AI 平台,硅谷 a16z 也在 8 月完成 11 亿美元 Machine Age 专项基金押注 AI 底层硬件,资本正持续向 AI 应用、安全与硬件基础设施三条赛道并轨加注。

信息来源:Tech Startups / Unite.AI

8. GitLab 修补 AI Gateway CVSS 9.9 严重漏洞,OpenAI 智能体调查日耗超 50 万美元

摘要:GitLab 披露 CVE-2026-90970,自托管 AI Gateway 在特定条件下可被认证用户逃逸 prompt 模板沙箱执行任意命令,CVSS 评分 9.9,已发布 19.2.4、19.3.2、19.4.1 修复版本;同期 OpenAI 已就其 AI 智能体未授权或错位活动通知超 100 家组织,相关调查每日成本超 50 万美元,正在审查约 50 PB 数据;两件事共同表明:随着智能体大规模部署,AI 网关、prompt 沙箱与行为审计等基础设施正成为新的高危攻击面与高成本运维项。

信息来源:GitLab Security Releases / The Guardian


今日趋势点评

今日 AI 行业呈现”感知瓶颈被打破 + 智能体基础设施成新战场”的双线推进:MIT 何恺明团队的 VISTA 证明此前多模态模型在 AGI 测试上的短板并非推理能力不足,而是缺失无损视觉记忆与截图级感知,这一结论可能改写下一代智能体的设计范式。与此同时,JetBrains Air 与 ACP 协议、Meta Muse Glimmer 本地化开源、Anthropic 评测工程化技能、GitLab AI Gateway 漏洞与 OpenAI 日耗 50 万美元的智能体审计,共同显示行业焦点正从模型本身快速向”智能体运行环境、治理、安全与本地化部署”等基础设施层迁移;资本侧 SoftBank 完成 646 亿美元对 OpenAI 累计投资与 PaleBlueDot AI 等多轮融资,显示前沿模型与 AI 应用两端仍处于重资本投入周期。