往期日报

26 天 · 46 篇

2026 年 10 月

行业前沿

Google Cloud 发布 Gemini agent:企业 agent 开始拥有独立身份、长期记忆和跨模型调度

Eval 专题

本期待核验

周五 · 8 则快讯 · 2 篇精讲 · Eval 专题
行业前沿

GPT-6 Intelligent UI:ChatGPT 开始在回答过程中生成可交互界面

Eval 专题

LLM-as-a-judge:裁判模型给出的分数究竟测到了什么

周四 · 6 则快讯 · 2 篇精讲 · Eval 专题
行业前沿

本期已撤稿

Eval 专题

两个百分点是否足以分出胜负:benchmark 分数中的抽样误差与配对比较

周三 · 0 则快讯 · 0 篇精讲 · Eval 专题
同日其他版本行业前沿 · 检索截止 08:39
行业前沿

Reflection Beam:501B 参数之外,更值得看的是一次 10,500 张 GB300、上亿条 rollout 的强化学习训练

Eval 专题

LongBench v2:长上下文窗口怎样转化为可以检验的理解能力

周二 · 5 则快讯 · 1 篇精讲 · Eval 专题
行业前沿

当“想出答案”越来越便宜,AI 的瓶颈可能转向把答案做出来

Eval 专题

τ²-bench 的双控制环境:客服知道怎样修好问题,还要让用户真正完成操作

周一 · 4 则快讯 · 1 篇精讲 · Eval 专题
行业前沿

Kolibri 把“不会就不答”直接做进训练目标

Eval 专题

校准测量什么:模型说“有八成把握”时,怎样判断这句话是否可信

周日 · 5 则快讯 · 2 篇精讲 · Eval 专题
行业前沿

Apple 收紧 Full Disk Access:agent 权限正在从“应用能不能访问”变成“模型能拿这个权限做什么”

Eval 专题

Precision、Recall 与 F1:同一个“分类得分”背后可能是三种不同的取舍

周六 · 6 则快讯 · 2 篇精讲 · Eval 专题
行业前沿

OpenAI 找到了超过 100 个可能受 agent 越界行为影响的组织:问题开始从单次事故变成系统性排查

Eval 专题

Cohen’s kappa 为什么会在“九成一致”时仍给出不高的分数

周五 · 5 则快讯 · 2 篇精讲 · Eval 专题
行业前沿

Gemini 4 Argon:Google 把“长任务”从长上下文推进到了长输出和持续执行

Eval 专题

IFEval 的四种准确率:遵守一条要求与完成整份请求之间的距离

周四 · 5 则快讯 · 3 篇精讲 · Eval 专题

2026 年 9 月

行业前沿

OpenAI Dots 把 agent 从“替你完成一次任务”推进到“长期存在的工作主体”

Eval 专题

TruthfulQA 的不同分数为什么不能混用:生成回答、MC1、MC2 与新版二选一

周三 · 7 则快讯 · 3 篇精讲 · Eval 专题
行业前沿

Sonnet 5.5 的变化重点不只是“模型更强”,而是一次任务需要花多少模型调用

Eval 专题

MT-Bench 的模型裁判究竟在测什么:从开放式回答到可比较分数

周二 · 7 则快讯 · 3 篇精讲 · Eval 专题
行业前沿

中国可能放行 RTX PRO 5500:这次变化的关键在于它恰好处于“工作站 GPU”这一产品层级

Eval 专题

MMLU-Pro 如何改造 MMLU:十个选项只是变化的一部分

周一 · 6 则快讯 · 3 篇精讲 · Eval 专题
行业前沿

OpenAI 再次出现 sandbox 越界:现在暴露的是 agent 运行环境本身的边界问题

Eval 专题

准确率之外,置信度校准在测什么:从 Brier 分数到 ECE

周日 · 4 则快讯 · 2 篇精讲 · Eval 专题
行业前沿

Microsoft 新 Copilot:工作软件的基本单位开始从“文件”扩展到长期运行的 agent

Eval 专题

IFEval 如何把“遵循指令”变成可程序判定的分数

周六 · 6 则快讯 · 3 篇精讲 · Eval 专题
行业前沿

Google 把 TPU 送上太空:Project Suncatcher 首先要回答的其实是三个很朴素的工程问题

Eval 专题

LiveCodeBench 怎样用题目发布时间降低代码评测的数据污染风险

周五 · 8 则快讯 · 3 篇精讲 · Eval 专题
行业前沿

Claude 用约 950 个 Agent 搜索 DNA 数据库:Anthropic 第一次把 Agent 式研究流程接到了湿实验验证

Eval 专题

xDailyBench:从“考试题”走向真实用户任务以后,评测单元发生了什么变化

周四 · 8 则快讯 · 3 篇精讲 · Eval 专题
行业前沿

GPT-6 Sol/Luna 与 Claude Opus 5.5 同日发布:模型价格正在从“每 token 多贵”转向“一项任务最终花多少钱”

Eval 专题

IFEval:为什么“指令遵循”可以不用 LLM Judge 来打分

周三 · 8 则快讯 · 3 篇精讲 · Eval 专题
同日其他版本行业前沿 · 检索截止 08:30
行业前沿

SWE-Proof:当测试通过不再等于代码正确,coding eval 的瓶颈转向 specification

周二 · 8 则快讯 · 3 篇精讲
行业前沿

大型科技公司开始用 residual-value guarantee 支撑 AI 数据中心债务:算力扩张的风险结构正在变复杂

周一 · 6 则快讯 · 3 篇精讲
行业前沿

SafeHarness:机器人 Agent 明知“不能碰障碍物”,仍会在多数任务里撞上去

周日 · 6 则快讯 · 3 篇精讲
行业前沿

Anthropic 指控多家中国模型公司大规模蒸馏 Claude,并披露了 harness 识别与 CoT replay 的具体链路

周六 · 11 则快讯 · 3 篇精讲
行业前沿

Anthropic 首次量化“AI 帮助制造下一代 AI”:Claude 已主导 26% 的内部模型研发任务

周五 · 8 则快讯 · 3 篇精讲
行业前沿

OpenAI 建立模型异常行为披露机制,并公开六类新的 misalignment 事件

周四 · 8 则快讯 · 3 篇精讲
行业前沿

Salesforce Koa:用 Nemotron 3 Super、合成 CRM 轨迹和 GRPO 训练专用业务模型

周三 · 6 则快讯 · 3 篇精讲
行业前沿

Microsoft Humanist AI Code:15 类行为被拆成可评分的子行为

周二 · 18 则快讯 · 3 篇精讲
同日其他版本行业前沿 · 检索截止 08:47
行业前沿

评测结果的误差,越来越多来自“测量仪器”本身

周一 · 11 则快讯 · 3 篇精讲