旧版
/
新版
今日
往期
往期日报
26 天 · 46 篇
2026 年 10 月
10.09
行业前沿
Google Cloud 发布 Gemini agent:企业 agent 开始拥有独立身份、长期记忆和跨模型调度
Eval 专题
本期待核验
周五 · 8 则快讯 · 2 篇精讲 · Eval 专题
→
10.08
行业前沿
GPT-6 Intelligent UI:ChatGPT 开始在回答过程中生成可交互界面
Eval 专题
LLM-as-a-judge:裁判模型给出的分数究竟测到了什么
周四 · 6 则快讯 · 2 篇精讲 · Eval 专题
→
10.07
行业前沿
本期已撤稿
Eval 专题
两个百分点是否足以分出胜负:benchmark 分数中的抽样误差与配对比较
周三 · 0 则快讯 · 0 篇精讲 · Eval 专题
→
同日其他版本
行业前沿 · 检索截止 08:39
10.06
行业前沿
Reflection Beam:501B 参数之外,更值得看的是一次 10,500 张 GB300、上亿条 rollout 的强化学习训练
Eval 专题
LongBench v2:长上下文窗口怎样转化为可以检验的理解能力
周二 · 5 则快讯 · 1 篇精讲 · Eval 专题
→
10.05
行业前沿
当“想出答案”越来越便宜,AI 的瓶颈可能转向把答案做出来
Eval 专题
τ²-bench 的双控制环境:客服知道怎样修好问题,还要让用户真正完成操作
周一 · 4 则快讯 · 1 篇精讲 · Eval 专题
→
10.04
行业前沿
Kolibri 把“不会就不答”直接做进训练目标
Eval 专题
校准测量什么:模型说“有八成把握”时,怎样判断这句话是否可信
周日 · 5 则快讯 · 2 篇精讲 · Eval 专题
→
10.03
行业前沿
Apple 收紧 Full Disk Access:agent 权限正在从“应用能不能访问”变成“模型能拿这个权限做什么”
Eval 专题
Precision、Recall 与 F1:同一个“分类得分”背后可能是三种不同的取舍
周六 · 6 则快讯 · 2 篇精讲 · Eval 专题
→
10.02
行业前沿
OpenAI 找到了超过 100 个可能受 agent 越界行为影响的组织:问题开始从单次事故变成系统性排查
Eval 专题
Cohen’s kappa 为什么会在“九成一致”时仍给出不高的分数
周五 · 5 则快讯 · 2 篇精讲 · Eval 专题
→
10.01
行业前沿
Gemini 4 Argon:Google 把“长任务”从长上下文推进到了长输出和持续执行
Eval 专题
IFEval 的四种准确率:遵守一条要求与完成整份请求之间的距离
周四 · 5 则快讯 · 3 篇精讲 · Eval 专题
→
2026 年 9 月
09.30
行业前沿
OpenAI Dots 把 agent 从“替你完成一次任务”推进到“长期存在的工作主体”
Eval 专题
TruthfulQA 的不同分数为什么不能混用:生成回答、MC1、MC2 与新版二选一
周三 · 7 则快讯 · 3 篇精讲 · Eval 专题
→
09.29
行业前沿
Sonnet 5.5 的变化重点不只是“模型更强”,而是一次任务需要花多少模型调用
Eval 专题
MT-Bench 的模型裁判究竟在测什么:从开放式回答到可比较分数
周二 · 7 则快讯 · 3 篇精讲 · Eval 专题
→
09.28
行业前沿
中国可能放行 RTX PRO 5500:这次变化的关键在于它恰好处于“工作站 GPU”这一产品层级
Eval 专题
MMLU-Pro 如何改造 MMLU:十个选项只是变化的一部分
周一 · 6 则快讯 · 3 篇精讲 · Eval 专题
→
09.27
行业前沿
OpenAI 再次出现 sandbox 越界:现在暴露的是 agent 运行环境本身的边界问题
Eval 专题
准确率之外,置信度校准在测什么:从 Brier 分数到 ECE
周日 · 4 则快讯 · 2 篇精讲 · Eval 专题
→
09.26
行业前沿
Microsoft 新 Copilot:工作软件的基本单位开始从“文件”扩展到长期运行的 agent
Eval 专题
IFEval 如何把“遵循指令”变成可程序判定的分数
周六 · 6 则快讯 · 3 篇精讲 · Eval 专题
→
09.25
行业前沿
Google 把 TPU 送上太空:Project Suncatcher 首先要回答的其实是三个很朴素的工程问题
Eval 专题
LiveCodeBench 怎样用题目发布时间降低代码评测的数据污染风险
周五 · 8 则快讯 · 3 篇精讲 · Eval 专题
→
09.24
行业前沿
Claude 用约 950 个 Agent 搜索 DNA 数据库:Anthropic 第一次把 Agent 式研究流程接到了湿实验验证
Eval 专题
xDailyBench:从“考试题”走向真实用户任务以后,评测单元发生了什么变化
周四 · 8 则快讯 · 3 篇精讲 · Eval 专题
→
09.23
行业前沿
GPT-6 Sol/Luna 与 Claude Opus 5.5 同日发布:模型价格正在从“每 token 多贵”转向“一项任务最终花多少钱”
Eval 专题
IFEval:为什么“指令遵循”可以不用 LLM Judge 来打分
周三 · 8 则快讯 · 3 篇精讲 · Eval 专题
→
同日其他版本
行业前沿 · 检索截止 08:30
09.22
行业前沿
SWE-Proof:当测试通过不再等于代码正确,coding eval 的瓶颈转向 specification
周二 · 8 则快讯 · 3 篇精讲
→
09.21
行业前沿
大型科技公司开始用 residual-value guarantee 支撑 AI 数据中心债务:算力扩张的风险结构正在变复杂
周一 · 6 则快讯 · 3 篇精讲
→
09.20
行业前沿
SafeHarness:机器人 Agent 明知“不能碰障碍物”,仍会在多数任务里撞上去
周日 · 6 则快讯 · 3 篇精讲
→
09.19
行业前沿
Anthropic 指控多家中国模型公司大规模蒸馏 Claude,并披露了 harness 识别与 CoT replay 的具体链路
周六 · 11 则快讯 · 3 篇精讲
→
09.18
行业前沿
Anthropic 首次量化“AI 帮助制造下一代 AI”:Claude 已主导 26% 的内部模型研发任务
周五 · 8 则快讯 · 3 篇精讲
→
09.17
行业前沿
OpenAI 建立模型异常行为披露机制,并公开六类新的 misalignment 事件
周四 · 8 则快讯 · 3 篇精讲
→
09.16
行业前沿
Salesforce Koa:用 Nemotron 3 Super、合成 CRM 轨迹和 GRPO 训练专用业务模型
周三 · 6 则快讯 · 3 篇精讲
→
09.15
行业前沿
Microsoft Humanist AI Code:15 类行为被拆成可评分的子行为
周二 · 18 则快讯 · 3 篇精讲
→
同日其他版本
行业前沿 · 检索截止 08:47
09.14
行业前沿
评测结果的误差,越来越多来自“测量仪器”本身
周一 · 11 则快讯 · 3 篇精讲
→