六个稳定主题框架;每个主题四条高密度卡片,点击可跳转。
关键判断:蛋白设计评测正在从“像不像自然序列”转向“能否稳定实现目标功能”;下一步应看多样候选在湿实验中的成功率,而非只看离线序列指标。
关键数据:约 85% 亚稳、68% 声子稳定;材料生成的竞争点正从产出数量转向在生成阶段编码物理约束,并用实验闭环验证,特别要追踪真实合成成功率。
关键数据:Recall@10 83.3%,较公开基线高 10.3 个百分点;后续应看跨地区复现、因果代理审计与应急部门实地验证。
关键判断:科研 Agent 的护城河正从会写假设转向会积累可复用验证技能;真正指标是单位实验成本带来的可证伪信息量,而非假设数量。
关键信号:浏览器自动化正从插件功能变成 Agent 桌面的默认能力;采购方应优先验收权限隔离、提示注入防护、提交前确认和可回放日志。
关键节点:广州全无人测试许可、2,000 辆内部订单;后续看脱离率、远程接管、运营设计域和跨城许可,而非一次道路演示,还需公开事故与接管口径。
关键趋势:世界模型正在分成“可执行因果状态”和“视觉呈现”两层;后续看长时一致性、用户交互延迟、安全沙箱与真实物理迁移。
关键数据:91.6% 失败含控制错误,OSWorld 达 64.7%;小模型 Agent 的瓶颈更多是控制架构,而非单次推理能力。
关键数据:2.3B 参数、约 4.6GB、9 种稳定语言;真正变量是复杂表格准确率、置信度缺口、每页成本与权限继承,企业验收应保留版面级抽样。
关键数据:85+ 语言,平均 WER 4.0% / 2.6%;后续看长音频稳定性、口音公平性、隐私设置与端到端单位分钟成本,并用真实通话独立复测。
关键节点:mistral-common ≥1.8.4;API 安全更新会同时影响隐私与客户端兼容,生产方应立即回归测试严格 schema。
关键信号:9 亿 Stock 素材 + 多模型提示词编辑;创意软件正把生成能力嵌入可撤销图层,而非另做一次性 AI 页面,版权血缘将成为采购门槛。
关键数据:B 轮 2.5 亿美元、估值 25 亿美元;下一步看私测留存、权限最小化、误操作赔付和真实任务成功率,不能用等待名单替代活跃度。
关键判断:这不是 70 亿美元成交,而是芯片控制权竞赛的谈判信号;后续看合作形式、融资估值、首片良率、软件迁移与实际出货,并核实双方正式披露。
关键数据:50 个品牌、最低日预算 725 卢比;后续应看广告负载、用户留存、答案独立性审计与广告收入占比,并比较不同收入群体的曝光差异。
关键判断:本期增量是提案在数据中心语境中的监管升温,而非 8 月新发规则;后续看最终文本、州级保留条款、诉讼和许可透明度,以及社区实际参与渠道。
关键数据:14 个暴露凭据、严重告警 30 分钟停机门槛;完整报告的价值在可复盘证据,后续看补救是否进入常态审计,并覆盖第三方通知时限。
关键数据:3 组外部团队、每组约 25 万条会话;下一步看持续访问机制、抽样误差、分类器审计与更多平台可比数据,同时公开退出与申诉机制。
关键数据:20 任务、13 模型,最长 24 小时 / 525 美元;评测正从问答准确率转向完整科研流水线的时间与费用,还要记录失败恢复和人工介入。
关键数据:回收 93% 失败场景,pass@1 0.132→0.529;失败数据只有经可验证修复,才是资产而非噪声,并需防止测试集信号泄漏。
关键节点:8 月 28 日 AoE 投稿、8 月 30 日补充材料;第二轮无 rebuttal,提交质量与可复现材料更关键,作者需提前完成匿名与冲突检查。
关键节点:8 月 28 日 11:00 PDT 截稿、9 月 2 日补充材料;会后重点看可复现代码、真实传感器和实时性能,并审查工业数据许可。
关键节点:9 月 1–2 日、20+ 国家;真正可执行信号是会后公报、共同原则与后续工作机制,而非会前嘉宾名单,还要观察各国落地差异。
关键节点:9 月 1 日 AoE 截止、9 月 27 日工作坊;后续看组合方法是否在真实长程任务中降低数据量与故障传播,并公开实机复现条件。
本期最强信号是“生成能力必须进入验证与责任链”:科研模型把价态、可执行实验和数据血缘前置;浏览器、文档、语音与创意产品则把模型嵌入已有权限、图层和企业接口。
资本与治理开始同频。个人 Agent 和自研芯片继续吸收巨额资金,Hugging Face 事故完整报告、ChatGPT 广告、数据中心许可与外部使用研究则要求市场同时交付停机、隐私、公众参与和独立审计证据。