六个稳定主题框架;每个主题四条高密度卡片,点击可跳转。
关键数据:四类任务平均相对提升 5.5%;后续应比较相同验证费用下的真实发现率、评分器偏差与跨任务参数稳定性,而不只看离线成功率。
关键数据:宏平均命中率 18.13%→25.96%;读者应关注转移证据能否跨材料族复用,以及预测改进是否在真实合成与表征中兑现。
关键判断:组件级安全不等于系统级韧性;后续应看真实 RTGS 数据校准、跨机构同质模型比例、对抗冲击下的资本与流动性缓冲,以及恢复演练结果。
关键信号:26 个案例、100+ 研究者把意外行为从趣闻变成治理对象;真正变量是能否在保留创造性的同时及时识别奖励漏洞,并区分可复现发现与偶然策略。
关键数据:三类场景赛全自主夺冠;下一步应公开逐任务成功率、接管、碰撞和复现视频,并与其他队伍的公开基线对照,让赛事从传播事件升级为可采购基准。
关键数据:外推任务 <21%,TLI 将 π0 由 9% 提到 83%;真正瓶颈是组合泛化、物理鲁棒性与边缘延迟,而不只是模型规模或室内平均分。
关键判断:机器人智能还没有跨过数据—可靠性—分发闭环;后续看垂直收入是否反哺通用能力、80%+ 开箱成功率能否持续,以及维修网络能否同步扩张。
关键数据:36B 动态 MoE、约 100 万小时视频;后续关键不是模型卡宣传,而是权重可得性、许可证、独立基准与产线长期运行。
关键数据:200 万新增 GPU、政府安全环境 10 万 GPU;下一步看区域上线节奏、有效利用率、电力约束和客户价格,而非名义卡数。
关键数据:2 纳米、512GB 统一内存、1.2TB/s 带宽;端侧 AI 的新门槛将是模型适配、数据治理与持续功耗,而非仅有峰值算力或宣传跑分。
关键数据:470M 参数、12,600+ RTFx、4.85%–5.00% WER;后续看消费级设备实时率、中文等多语种扩展与许可证合规。
关键数据:成本低 1.2–2.0×、容量/美元 16.5×、时延增 8%–93%;选择取决于 SLA、并发峰值与模型尺寸,而不是单一压缩率或显存节省数。
关键数据:营收 962 亿美元、数据中心 890 亿美元、毛利率 75%;后续看需求多样性、客户回报、能源与封装约束能否支撑同等增速,并排除循环融资带来的虚假繁荣。
关键数据:追加近 2 亿美元、B 轮累计 6 亿美元、估值 30 亿美元;核心验证仍是跨本体泛化与真实收入,资本热度不能替代现场任务数据。
关键信号:基础设施组织重组与关键岗位更替同发生;后续应看算力项目是否按期交付、权责是否清晰、公开披露是否改善,尤其关注对政府和企业客户承诺的影响。
关键节点:8 月 24 日律师函后项目与实例暂停;后续应看仓库移除诉求能否成立,以及主机、分发平台、数据使用者与开发者如何分担责任。
关键数据:49,327 个样本、151,876 次调用、平均 +5.98 个百分点;上线时应优先监控每个百分点的边际成本、延迟及选择器误差。
关键判断:最佳监督单元是 1–2 个动作;安全报告必须成对披露捕获与误拒,否则无法判断真实鉴别力,也不能发现因上下文缺失造成的盲点。
关键数据:TensorTrust 攻击成功率 34.8%→6.6%;后续看服务栈能否保真传递标注,以及多轮 Agent 是否出现新绕过。
关键趋势:策略从文档走向可执行、可版本化资产;后续应看规则冲突、跨模型一致性和运行时违规可解释性,并用独立红队验证规则真的生效。
关键节点:9 月 3 日截止、9 月 23 日预计公布结果;值得跟踪的是工具调用的可靠性证据、权限撤回是否可用,而不是参赛作品数量。
关键节点:9 月 7–11 日;重点关注 Agentic Systems、可信 AI、绿色计算与“系统而非模型”议题是否给出可迁移证据。
关键趋势:社会智能体评测正从对话流畅走向合作后果;会后重点追踪长期实验、跨文化数据、真实场景失败披露,以及高风险岗位的人工退出机制。
关键节点:9 月 9–10 日、两天混合会议;最值得关注的是用例挑战能否转化为可审查的认证、更新、运行监控方法与事故责任分配。
本期最强信号是“规模与约束同时上升”:200 万块新增 GPU、512GB 端侧统一内存和 962 亿美元单季收入继续抬高基础设施天花板;与此同时,科研搜索、预执行监督和系统风险研究都在追问有限预算、误拒绝与连锁后果。
物理 AI 的资本热度与技术成熟度仍有明显时差。机器人团队需要用公开失败率、长期运行和数据回流证明价值;企业 Agent 则应把带外身份、策略即代码与最小权限做成默认基础设施。