六个稳定主题框架;每个主题四条高密度卡片,点击可跳转。
关键判断:科研 Agent 的分水岭已从会写研究计划转向能控制实验、吸收阴性结果并复现结论;后续应追踪跨实验室重复率和单位有效发现成本。
关键数据:剂量—反应流程约 3× 提速;标准能否成立取决于厂商采纳、安全联锁和跨品牌兼容,而非一次演示。同时应公开失败样本、复现条件与成本口径。
关键判断:反应模型正从终点分类转向可审查的电子转移过程;后续核心是机制正确率、置信校准和新反应类型上的实验复现。同时应公开失败样本、复现条件与成本口径。
关键数据:80 个流程、约 5,000 GPU 小时、lDDT +7.5%;自动科研的价值必须按可迁移收益除以搜索成本衡量。同时应公开失败样本、复现条件与成本口径。
关键数据:低于 12GB 显存、迁移至 26-DoF 人形机器人;跨具身预训练正成为单机型世界模型的新起点。同时应公开失败样本、复现条件与成本口径。
关键数据:单 GPU 超过 30Hz;真正商业门槛是 P99 控制延迟与实机成功率,而不是实验室平均吞吐。同时应公开失败样本、复现条件与成本口径。
关键数据:5,400 组场景对、8,200 个对象;长程重排的关键不在单次抓取,而在关系记忆与失败恢复。同时应公开失败样本、复现条件与成本口径。
关键判断:机器人通用性不只来自大模型,也可来自可重构机械本体;后续看循环寿命、载荷比、自动组装与闭环控制成本。同时应公开失败样本、复现条件与成本口径。
关键数据:Terminal-Bench 4.6→28.3、Cyber Gym 84.5;开放权重的真实价值要由可部署成本与独立安全评测决定。
关键数据:最长 40 秒、360p 提速 60%、成本约 1/3;视频生成正从单镜头走向可延续工作流与分层成本控制。同时应公开失败样本、复现条件与成本口径。
关键趋势:Agent 竞争正从一次性上下文长度转向可审计技能资产;后续看跨模型迁移、过时检测和恶意技能隔离。同时应公开失败样本、复现条件与成本口径。
关键判断:主权模型的核心不是一次训练,而是持续更新、许可可控与审计闭环;开放权重并不自动等于低成本或自由商用。同时应公开失败样本、复现条件与成本口径。
关键节点:供应链风险标签被裁定违法,但上诉仍可能改变执行边界;政府 AI 采购将更依赖书面证据、程序正义和用途级限制。同时应公开失败样本、复现条件与成本口径。
关键信号:100+ 联署机构;下一步应看共享机制、演练结果和关键设施修复时长,而非只看原则性声明。同时应公开失败样本、复现条件与成本口径。
关键数据:数亿元 B 轮、400G/800G Scale-out;国产智算的下一处瓶颈正从单芯片转向集群互联与软件适配。同时应公开失败样本、复现条件与成本口径。
关键数据:超 1 亿美元;产业资本的价值在于开放真实产线,但估值能否兑现取决于数据飞轮转成稳定订单。同时应公开失败样本、复现条件与成本口径。
关键判断:可信评测需要同时保护题库和模型权重;安全飞地解决保密,不会自动解决题目代表性、统计功效与评分偏差。同时应公开失败样本、复现条件与成本口径。
关键判断:测试是安全治理的证据源之一,不是免责证书;后续政策应把模型分数接到部署边界、持续监测和事故责任。同时应公开失败样本、复现条件与成本口径。
关键数据:约 23 万份文档、4 家合成企业;企业 Agent 评测正在把权限与流程纳入任务本体。同时应公开失败样本、复现条件与成本口径。
关键数据:6.5%→54%,伪造 36.8%≈真实 37.6%;安全关键是可训练但脆弱的“行动门”,不是口头置信度。同时应公开失败样本、复现条件与成本口径。
关键节点:8 月 30 日评审、9 月 5 日答辩;作者应先核对最新官网时间,再集中回应可改变评分的技术问题。同时应公开失败样本、复现条件与成本口径。
关键节点:9 月 7–8 日、苏黎世;应关注会后是否给出责任分配、申诉渠道和可持续监管工具。同时应公开失败样本、复现条件与成本口径。
关键数据:9 月 14–17 日、75+ 成员国 RAM;下一步看原则是否转化为预算、监管机构能力和可审计采购要求。同时应公开失败样本、复现条件与成本口径。
关键节点:9 月 11 日 AoE 截稿;生产级 LLM 的学术评价开始从模型分数转向生命周期、治理和运营成熟度。同时应公开失败样本、复现条件与成本口径。
本期最强信号是 AI 正从“生成答案”进入可执行、可验证的现实系统:科研 Agent 接管实验闭环,跨具身世界模型与实时 VLA 降低机器人试错,开放权重和主权模型则把控制权下沉到部署方。
治理也开始匹配这一变化。法院要求政府拿出可说明的风险证据,集体网络防御、双盲评测和多边伦理论坛把责任、保密、持续监测与申诉机制推到同一张基础设施清单上。