6 个稳定主题、24 条内容;当日产业事件、24–48 小时学术更新与未来 7–16 天明确节点分层呈现。
关键数据:论文在留出数据集上,以统一筛选 1/3 的实验预算 达到相同有效组合命中率;后续应盯临床外部验证与批次偏差。
关键数据:温度和风速的 CRPS 分别改善 11.5% 与 6.2%,且在 Aurora 后处理中仍保留增益;需关注极端事件的尾部表现。
关键判断:后续应比较“每增加一单位 oracle 调用带来的结构质量增益”,而非只看一次性榜单;这会直接影响商业定价和实验调度。
关键信号:科研 Agent 的竞争点正从会不会写综述,转向能否将 4300 万篇 跨学科文献组织为可审计的机理假设与实验计划。
关键数据:真实机器人成功率 76.7%,对比 π0.5 的 53.3%;后续需看长时间运行、失败恢复和跨硬件迁移。
关键数据:VLA-Arena 得分从对比方法的 0.44/0.22 提升到 0.63,LIBERO 为 98.8%;应继续验证真实环境的长尾扰动。
关键数据:RIFT 在 LIBERO 达到 98.8%,并将推理延迟降低 68.2%–89.1%;生产端应盯最坏时延而非均值。
关键数据:在已见/未见环境中成功率为 32.04% / 29.46%;目前仍属研究阶段,真实风场和通信丢失是下一道门槛。
关键数据:平均得分从 0.49 升至 0.91,且无参数更新;后续应披露每额外一分准确率对应的 token、延迟和重试成本。
关键数据:最佳模型在单跳任务仅 70.4%,复合 API 降至 50%–51%,某些不可回答政策问题低至 2.4%。
关键数据:相比普通渲染缓存,F1 提升 21.6 个点,相比完整前填充 TTFT 下降 83.8%;需盯动态文档下的缓存失效率。
关键节点:8 月 2 日后在欧盟发布的新模型从首日标记,旧模型过渡期到 12 月 2 日;企业应立即检查文档溯源与申诉流程。
关键数据:本轮 50 亿美元 / 1900 亿美元估值,投资意向曾达 150 亿美元;资本正向“能用 Agent 收益支撑云开销”的数据平台集中。
关键数据:Thrive 以 20 亿美元融资 / 120 亿美元估值 扩张;TaxAI 处理 7000 份税表、宣称准确率 98%,报税准备时间下降超 30%。
关键数据:本轮 4 亿美元 / 133 亿美元估值,年化收入运行率约 5 亿美元;市场将开始更严格检验续费、毛利和安全事故率。
关键数据:季度收入 269.43 亿美元,+43%,AI 相关收入 93 亿美元、占 35%;ISG 收入增长 98%,是后续毛利与现金流的关键变量。
关键数据:12 个多模态模型 的评测表明,图到代码显著难于图示问答;后续榜单应分开几何忠实度、语义正确性与可编辑性。
关键数据:语言化采样的留出成功率最高提升 9%,群体协同训练进一步提升 14%;后续需看不同人群是否被充分覆盖。
关键数据:成本预测误差为 18%–69%,准确率仅 21%–54%;应将“记忆成本/有效找回事实”变成上线前的基本财务指标。
关键判断:安全基准如果没有“状态持续+真工具副作用”,就会高估 Agent 防御能力;后续应关注对齐方法在不牺牲正常任务完成率时的改善。
关键节点:8 月 20 日 起施行;发现问题完成整改后 15 个工作日内需报送情况,AI 数据平台应在生效前完成主体、数据和证据链清点。
关键节点:8 月 21 日 截稿,9 月 15 日通知,11 月 1–5 日于里斯本混合举办;团队本周应优先锁定论文类型与复现材料。
关键节点:8 月 24–30 日 在立陶宛维尔纽斯举行,其中 RuleML+RR 为 24–26 日、Reasoning Web 为 27–30 日;建议盯学习、推理与规划的交叉课程。
关键节点:8 月 24–26 日 在美国佐治亚州 Guardian Centers 开展;后续应看课程是否公开故障案例、复盘指标和跨厂商互操作结果。