今日快讯

01

Anthropic 发布 Claude Haiku 5.5,大幅降低轻量模型价格。10 月 7 日,Anthropic 推出 Claude 5.5 系列的第三款模型 Haiku 5.5,面向分类、摘要、信息提取、客服和 coding subagent 等高频任务。对于不超过 10 万 token 的请求,API 输入价格为每百万 token 0.10 美元、输出 0.50 美元,均比 Haiku 4.5 低 90%;超过这一长度后,价格分别升至 0.50 和 2.50 美元。Anthropic 称,考虑实际 token 消耗后,平均任务成本降低约 75%。模型已在 Claude Platform、AWS、Google Cloud 和 Azure 开放。同时,Sonnet 5.5 的缓存读取价格减半,Anthropic 估计这使多数 agent 工作负载成本降低约 20%。Anthropic 官方发布 · Reuters

02

微软将 AI agent 的操作系统隔离机制正式带入 Windows。10 月 7 日,微软宣布 Microsoft Execution Containers(MXC)在 Windows 11 正式可用。它允许为 agent 设置文件和网络访问范围,并在运行时执行这些限制。微软列出的现有支持者包括 Codex、GitHub Copilot、OpenClaw、Replit 和 LM Studio;Claude Code 等产品的支持仍在计划中。同场发布的还有 Windows 本地与云端模型混合调用方案,但 Copilot 的相关新能力预计未来数月才会逐步推出。MXC 的正式可用与 Copilot 新功能的后续上线是两个不同的交付状态。微软 Windows 官方博客

03

NVIDIA RTX Spark 进入 Windows 笔记本,Surface Laptop Ultra 开放预订。微软与 NVIDIA 10 月 7 日公布基于 RTX Spark 的新一代 Windows 设备。Surface Laptop Ultra 采用 NVIDIA Grace CPU、Blackwell RTX GPU 和最高 128GB 统一内存,微软称可在本地运行超过 120B 参数的模型;起售价 2,599 美元,10 月 16 日开始供货。面向开发者的 Surface RTX Spark Dev Box 起售价 5,999 美元,计划 11 月发货。上述模型运行能力和性能数字来自厂商测试,具体仍取决于量化、上下文长度和软件环境。微软设备公告 · NVIDIA

04

三星第三季度营业利润预计同比增长近九倍。10 月 8 日清晨,三星电子披露初步业绩,预计第三季度营业利润达到 107.4 万亿韩元,上年同期为 12.17 万亿韩元;营收预计达到 195 万亿韩元,同比增长约 127%。Reuters 将增长主要归因于 AI 基础设施需求带动的存储芯片涨价,包括传统 DRAM、NAND 和高带宽内存。三星尚未公布各业务部门的详细利润构成,完整财报定于 10 月 29 日发布。这组数据说明 AI 算力扩张的影响已经明显传导至整个存储市场,而不仅限于 GPU。Reuters

05

美国科技联盟提出 National Compute Grid,尝试共享闲置 AI 算力。10 月 7 日,Axios 报道,一个由 AI 公司、云服务商、研究人员和投资者组成的联盟正在启动 National Compute Grid,希望通过统一调度系统连接不同数据中心的空闲计算资源。联盟称,目前约有 760MW 算力容量已经接入或处于潜在接入范围,目标是在 2030 年达到 2GW。系统计划展示芯片类型、位置、价格和可用容量,并优先向政府、教育和国家实验室等公共部门开放。现阶段这是一个新启动的协作项目,其实际利用率改善尚未得到验证。Axios

06

补报:OpenAI Decisions API 进入公开测试。OpenAI 于北京时间 10 月 7 日凌晨宣布开放 Decisions API 公测,允许开发者提交文本或图片,让模型直接返回条件成立的概率、预定义选项或分级评分。当前仅支持 GPT-6 Luna,输入价格为每百万 token 0.10 美元,不另收输出 token 费用。OpenAI 称,同模型下这一专用接口的决策速度可达到 Responses API 的约十倍。它适用于分类、路由和优先级判断;需要生成完整结构化对象或解释性文字时,仍应使用 Responses API。该接口目前没有输入缓存机制。OpenAI 开发文档 · 开发者公告

串读精讲

1 / 2

GPT-6 Intelligent UI:ChatGPT 开始在回答过程中生成可交互界面

OpenAI 10 月 7 日宣布,将 GPT-6 与 Intelligent UI 一起推向更广泛的 ChatGPT 用户。此前 GPT-6 已经向部分付费用户开放;这次更新的重点是 ChatGPT 的回答形式和交互过程。

Intelligent UI 允许模型根据问题选择文字、图片、图表、表单、按钮和其他交互组件。用户询问一个统计概念,回答可以包含可调整参数的图表;询问旅行计划,可以看到地图和行程安排;需要计算退休储蓄或分摊账单时,ChatGPT 可以直接生成一个在对话中使用的小工具。

这项能力从 10 月 7 日起面向 Plus、Pro、Business 和 Enterprise 用户逐步推出,10 月 8 日开始扩展至 Free 和 Go。不同套餐使用 GPT-6 Sol 或 Luna。OpenAI 特别说明,本次更新适用于 ChatGPT 的 Chat 体验,不改变 Work 和 Codex 使用的模型。OpenAI 官方发布

这次变化的技术关键,是 OpenAI 如何让模型在生成答案的同时组织界面。

过去,语言模型的输出主要是一段文本。即使要展示图表或表格,也常常需要先生成数据,再交给另一个工具或前端程序渲染。对于一个真正可交互的应用,开发者通常还要预先决定有哪些页面、组件和操作流程。

Intelligent UI 采用了不同的组织方式。OpenAI 建立了一套原生、可流式输出的界面组件库,并配套一个编译器。模型生成回答时,可以同时决定需要哪些组件、它们如何排列、包含什么内容;编译器则在输出尚未结束时处理这些界面描述,让组件逐步出现在用户面前。

例如,用户要求解释七速自行车的结构。模型可以生成一张带有不同部件入口的交互图,读者点击车架、传动系统或制动器时,再查看对应说明。这里的界面结构并不需要用户事先指定,也不需要每个问题都对应一个人工预制页面。

OpenAI 表示,模型为此接受了专门训练,学习如何选择内容形式、组织布局、使用交互,以及判断什么时候简单文字已经足够。训练和评价涉及清晰度、实用性和完整性等方面,但官方没有公开足以让外界完整复现这套界面生成训练的技术细节。OpenAI

这实际上给语言模型增加了一种新的决策:除了决定回答什么,还要决定用户应该怎样接收和操作这个回答。

这种能力的价值取决于任务类型。对于一个需要明确事实的简单问题,额外生成界面只会增加阅读成本;对于涉及空间关系、参数变化、多种方案比较或反复计算的任务,交互组件可以把原本需要读者在脑中完成的操作直接呈现出来。

比如解释正态分布时,一段文字可以准确描述均值和标准差,但读者往往仍需要想象曲线如何变化。如果回答中有一个可以拖动参数的图表,用户就能直接观察均值改变时曲线怎样平移、标准差改变时曲线怎样变宽。这种交互的收益来自降低理解过程中的操作成本,未必意味着底层模型掌握了更多统计知识。

因此,Intelligent UI 也带来了新的质量问题。

传统回答主要检查事实是否正确、解释是否完整。生成界面以后,还需要判断交互是否真的帮助理解,组件之间的状态是否一致,用户修改参数后结果是否正确,以及界面有没有因为视觉呈现而掩盖不确定性。

一个计算器可以设计得很好看,但公式仍然可能错误;一张图表可以提供很多按钮,但坐标轴和数据口径仍然可能误导读者。界面质量与内容正确性需要分别验证。OpenAI 已经表示在训练中评价界面的清晰度和完整性,但此次公告没有提供足够证据,证明生成式界面在各种任务上都优于固定界面。

另一个值得注意的变化发生在响应时间。

OpenAI 同时宣布,GPT-6 可以在继续推理或调用工具时开始回答。过去,推理模型经常需要先完成内部计算,再输出完整回复;新的交互方式允许模型先呈现已有的可靠部分,然后随着后续计算和检索继续补充内容。

OpenAI 称,在需要网络搜索的问题中,GPT-6 Instant 的平均开始回答时间比 GPT-5.6 Instant 提前 44%。在其内部高价值日常 agent 任务评测中,GPT-6 Extra High 可以用接近 GPT-5.6 Medium 的时间开始回答,同时取得优于 GPT-5.6 Extra High 的总体成绩。这些是 OpenAI 的内部测试结果,衡量的是特定条件下的响应速度和任务表现,不能直接理解为所有问题的总完成时间缩短了 44%。OpenAI

逐步回答与逐步生成界面实际上解决了同一个产品问题:复杂模型能够完成的任务越来越多,但用户不希望每次都等待一个完整、静态的最终结果。

如果模型需要搜索资料、计算数据并绘制图表,用户可以先看到问题的基本结构,再等待证据和计算结果填充进来。对于多步骤任务,这可能比长时间没有反馈、最后一次性显示全部内容更容易使用。

不过,这也要求模型正确区分哪些内容已经得到支持,哪些仍在计算或检索中。过早输出一个看起来完整的结论,随后再悄悄修改,会损害用户对结果的理解。渐进式交互因此同时是响应速度问题和信息状态管理问题。

从软件产品的角度看,Intelligent UI 还提出了一个更长远的可能性:部分过去需要单独开发的小型交互工具,可以在对话发生时即时生成。用户无需先寻找专门的计算器、可视化页面或表单应用,只需描述任务,系统就能在既有组件库中组织出相应界面。

目前,这项能力仍然运行在 ChatGPT 提供的组件和交互框架内。它不意味着模型可以任意生成、安装和安全运行完整软件,也没有取消专业应用对可靠状态管理、权限和长期维护的要求。

10 月 7 日这次发布真正可以确认的变化,是 OpenAI 已经把界面选择和生成纳入 ChatGPT 的日常回答流程,并开始大规模部署。未来这类能力是否能稳定提高复杂任务的完成率,还需要观察真实使用数据,以及界面正确性、交互成本和用户理解效果的独立评价。

2 / 2

Biohub 扩大 Virtual Biology Initiative:为细胞预测模型建设可训练的实验数据

10 月 7 日,Biohub 宣布扩大今年 4 月启动的 Virtual Biology Initiative。美国能源部、美国国立卫生研究院,以及 Google DeepMind、Isomorphic Labs 和 Meta 等机构加入,使项目涉及的资金、既有数据、计算资源和测量技术总投入达到约 18 亿美元。

这次扩展的重点是建立一套可供 AI 训练的生物学数据基础设施。Biohub 希望未来模型能够预测细胞在不同干预条件下的反应,使研究人员先通过计算筛选实验方向,再进入真实实验室验证。Biohub 官方公告 · 美国能源部

理解这项计划,需要先区分两类生物学数据。

一类是观察性数据:研究人员测量某种细胞在某个时刻表达哪些基因、包含哪些蛋白质、呈现什么形态。这类数据可以帮助模型认识细胞类型和状态。例如,模型可以根据基因表达模式,判断一个细胞更接近免疫细胞、神经细胞还是其他类型。

另一类是干预性数据:研究人员主动改变某个条件,再测量细胞发生了什么。干预可能是关闭一个基因、加入一种药物、改变营养条件,或者让细胞与其他细胞共同培养。

如果目标只是识别细胞类型,观察性数据已经非常有价值;如果目标是预测一种治疗手段会造成什么变化,干预性数据就变得格外重要。

原因在于,模型即使准确学会了哪些分子经常同时出现,也未必知道改变其中一个会引起什么后果。生物系统包含复杂的反馈和调控机制,观察到的相关性不足以直接支持干预预测。

Virtual Biology Initiative 因此计划扩大对细胞反应的系统测量:让更多细胞类型在更多环境和干预条件下接受实验,记录分子、细胞和组织多个尺度的变化,再将这些结果组织成适合模型训练的数据。

Biohub 官方公告明确提到,项目将发展能够在活体组织中观察数百万至数十亿细胞的显微成像技术,以及用于观察细胞内部精细结构的冷冻电子断层扫描。美国能源部则将提供超级计算、X 射线与中子散射、先进成像和自动化实验室等能力。Biohub · 美国能源部

这些技术解决的是不同层面的信息缺口。

基因表达测量可以告诉研究人员一个细胞正在使用哪些分子程序;空间转录组技术能够进一步保留这些活动发生在组织中的什么位置;高分辨率成像可以观察细胞结构和相互作用;实验干预则提供条件改变前后的对应关系。

把这些数据结合起来,模型才有机会同时学习细胞的组成、空间环境和动态反应。

但多模态数据也带来了标准化难题。不同实验室使用不同设备、试剂、测量流程和数据格式,同一个细胞类型可能存在不同命名,实验条件也未必能够直接比较。即使收集到海量数据,如果不能准确知道每条记录对应什么细胞、什么处理条件、什么测量方法,模型也可能把实验室之间的技术差异误认为生物学规律。

这就是为什么 Biohub 的计划包含统一标识符、共享数据标准和统一访问入口,而不只是采购更多实验设备。

10 月 7 日的合作安排把不同机构的资源分配得相当明确。Biohub 在 4 月已经承诺投入 5 亿美元,其中 4 亿美元用于测量技术和内部数据生产,1 亿美元用于外部研究。此次 Google DeepMind、Isomorphic Labs 和 Meta 合计新增承诺 3 亿美元;美国能源部将在五年内投入超过 5 亿美元;美国国立卫生研究院则负责协调利用此前超过 5 亿美元联邦投资形成的数据集、知识库和研究基础设施。

因此,18 亿美元包含新资金、此前承诺的投入和既有公共数据资源,不能简单理解为 10 月 7 日当天新增了 18 亿美元现金。Biohub

项目的数据开放安排也值得仔细区分。

Biohub 将其定位为面向全球科研社区的开放数据基础设施。不过,Biohub 科学负责人 Alex Rives 在接受 Reuters 采访时说明,商业资助者对其资助产生的部分数据享有一段提前使用期,之后数据才会公开;与之并行的政府资助工作不附带这种限制。

这意味着最终开放与所有参与者同时获得数据之间存在差别。提前使用期的具体长度没有在这次报道中披露,外部研究者也还无法判断不同批次数据的开放速度。Reuters

这项计划还有一个与语言模型发展经验有关的问题:生物学模型是否也能通过扩大训练数据获得持续、可预测的能力提升?

在语言模型中,研究人员可以从大量文本学习语言规律,再通过任务训练获得推理和工具使用能力。但生物系统中的一次实验比获取一段文本昂贵得多,许多重要状态也无法被完整观测。更复杂的是,细胞会根据环境变化,同一种干预在不同组织、发育阶段和疾病条件下可能产生不同结果。

因此,增加细胞数量虽然重要,数据覆盖的干预类型、实验条件和生物学尺度同样决定模型能否推广到未见过的情况。

Biohub 负责人在 Reuters 采访中表示,当前细胞数据集的规模达到数亿细胞,而准确预测模型可能需要数十亿甚至数万亿细胞的数据。这是项目负责人的规模判断,目前尚不能据此确认生物学模型存在类似语言模型的统一 scaling law。

他还表示,项目希望约一年后交付首批数据,并在五年内建立准确的预测模型。这些属于研究目标和预期时间表,10 月 7 日并没有发布一个已经验证、可以通用模拟细胞反应的模型。Reuters

这次合作最有价值的地方,是它把 AI for Science 中一个长期存在的问题转化为具体的基础设施建设:为了训练能够预测真实世界变化的模型,研究机构必须主动制造模型需要的实验数据。

如果未来模型能够可靠预测某类细胞对药物或基因干预的反应,研究人员便可以在大量候选方案中优先选择最有希望的方向,减少低价值实验。不过,模型预测仍然需要真实实验验证,尤其是在跨细胞类型、跨组织和涉及疾病机制的场景中。

Biohub 当前正在建设的是产生、组织和共享这些证据的能力。它的成败将逐步体现在可公开使用的数据规模、干预条件覆盖、实验重复性,以及模型能否预测训练数据之外的生物反应上。