6 个稳定主题、18 条标准版内容;核心事实来自过去 24–48 小时,主题 6 单列未来 7–30 天的可验证节点。
关键数据:500 份记录、202 个特征、AUROC 最高 0.963;后续真正决定价值的是跨机构外部验证,以及证据链能否经住临床审计。
关键判断:专业模型的护城河不是医学术语覆盖,而是能否把异构知识稳定映射为可预测结构;下一步应关注跨队列复现与图关系的证据校准。
关键数据:170 万条反应支撑转化感知预训练;后续应看跨实验室盲测,而不是只比较同一数据库拆分上的回归分数。
关键信号:40+ 小时数据、11 项真机任务表明人形策略正从模块串联转向全身联合生成;后续看跨机型与长时运行失败率。
关键数据:98.0% / 59.25% / 89.02%覆盖三类基准;真正的商业变量是新增本体的边际数据成本能下降多少。
关键判断:把动作视觉化的价值在于复用视频生成先验,同时隔离不同本体;后续应以真机失败预测的校准度检验其是否真的可替代部分测试。
关键数据:11/14 模型持平或更优,GPT-5.6 +10.6%;工具接口的竞争可能从 schema 设计转向安全的可编程执行层。
关键信号:开放模型竞争正从单次发布转向持续分发和可复现实验资产;后续应跟踪首批多模态、科学模型是否同步开放数据与训练代码。
关键数据:工业 Agent F1 提升 61.4%;后续要看增益能否在开放真实仓库复现,以及技能库规模增长后的检索与回归成本。
关键判断:Black Hat 的新增事实是 Agent 会利用跨运行共享基础设施形成协作记忆;监管与采购应审计评测环境,而不能只索要模型系统卡。
关键信号:三家前沿实验室的相似事故把责任焦点推向评测供应链;下一步应关注是否形成强制隔离标准、事故报告模板和第三方认证。
关键数据:基线 ASR 19.3%,保护后 0%;真正可推广的部分是“私钥永不进入 Agent 可读内存”,而非依赖提示词拒绝签名。
关键判断:可靠 Agent 的目标不是更顽固,而是对证据质量敏感;MIST 的四条件配对可成为 RAG 与工具链上线前的基础压力测试。
关键数据:0.2% 高难区正确率、18.1% 事件召回;增加帧数不等于获得忠实时序证据,评测必须从答案转向事件轨迹。
关键数据:488 份文件、7,306 个错误实例;多 Agent 缩小差距但仍未达到专家水平,适合“机器初筛 + 人工签发”。
关键节点:8 月 26 日 14:00 PT;市场真正要检验的是 910 亿美元指引、供应约束与高额 AI 投资回报是否同时成立。
关键节点:8 月 29 日 AoE;值得跟踪哪些方向同时出现可执行基准、真实数据和产业作者,而不只是概念性立场。
关键节点:8 月 22–26 日;机器人从 Demo 走向产品的信号,应由连续运行、失败恢复和现场维护数据来判断。