AppliedModelsTech Daily

AppliedAI · 综合 · 2026-10-08

Anthropic 发布 Claude Haiku 5.5,大幅降低短提示请求价格,并下调 Sonnet 5.5 的缓存读取费。10 月 7 日发布的 Haiku 5.5 已在 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 提供服务。提示长度不超过 10 万 token 时,每百万输入、输出 token 分别收费 0.10、0.50 美元;超过该长度则分别为 0.50、2.50 美元。两个档位相对 Haiku 4.5 的单价分别降低 90% 和 50%。发布方所说的“平均运行成本降低约 75%”,还考虑了请求分布及新 tokenizer 带来的 token 用量变化,不能直接理解为所有任务都便宜四分之三。发布说明与价格条件。

Haiku 5.5 首次为 Haiku 系列加入可调推理 effort,让开发者在计算投入与能力之间选择。Anthropic 同时将 Sonnet 5.5 的缓存读取价格减半至每百万 token 0.10 美元。两项调整作用于不同的成本来源:前者降低大量独立调用的价格,后者降低 agent 反复读取已有上下文的费用。具体任务是否值得迁移,仍取决于完成一次工作需要多少调用、输出和重试;便宜的单价只有在任务成功率能够维持时,才会转化为便宜的交付。

微软宣布 Microsoft Execution Containers 正式可用,为 agent 的文件、网络和桌面操作提供独立于模型的执行边界。10 月 7 日的官方说明将 MXC 定义为基于策略的执行层:开发者声明任务所需资源,由容器在运行时执行限制,agent 或其生成的代码不能自行扩大权限。隔离方式包括进程容器、Windows 专有的会话容器和 WSL 容器;MicroVM 后端仍处于实验阶段。微软还表示,Entra 的 agent 身份区分及部分企业管理能力将随后提供,不能把这些后续能力一并视为已经交付。正式发布说明。

这项工作的实际价值,可以用一个简单权限关系理解:维护网站的 agent 可以修改代码仓库、读取部署配置,同时被禁止改动部署配置。模型即使认为修改配置更容易完成任务,也不能越过执行层的限制。由此,任务是否完成与操作是否得到授权,可以分别处理;组织能够放开一部分自动化工作,而无需同时交出员工账户的全部权限。隔离也有实现成本:权限过窄会阻断必要操作,过宽又会削弱保护,因此容器策略本身成为应用交付的一部分。

Biohub 扩大虚拟生物学合作,公布合计 18 亿美元的资金、数据、计算和测量技术投入。10 月 7 日,Biohub 宣布美国能源部、美国国立卫生研究院,以及 Google DeepMind、Isomorphic Labs、Meta 等参与扩展合作。这个总额包含不同性质的资源:能源部计划五年投入超过 5 亿美元;NIH 协调贡献由此前超过 5 亿美元联邦投入形成的数据与知识资源;三家企业合计投入 3 亿美元;Biohub 此前承诺的 5 亿美元构成项目基础。因此,18 亿美元不能全部称为本次新增现金融资。Biohub 公告、Isomorphic Labs 参与说明。

本次扩展的核心交付目标是能够训练预测模型的生物数据,尤其是不同细胞在不同干预条件下如何响应,以及让跨机构数据能够共同使用的标准、标识与访问基础设施。“虚拟细胞”仍是要推进的研究目标,公告并未交付一个已经能可靠替代实验的通用模型。这里值得关注的产业选择是:几家拥有模型能力的机构共同投资测量和数据生产。对于需要预测现实系统的 AI,训练材料能否覆盖真正关心的干预,可能比继续扩大已有数据集更决定能力边界。

ChatGPT 开始按问题生成交互界面,应用价值进一步取决于怎样组织答案

OpenAI 于 10 月 7 日宣布在 ChatGPT 中推出 GPT-6 与 Intelligent UI。付费层级从当日开始全球逐步开放,Free 与 Go 从次日开始扩展;企业用户还受管理员设置影响。本次更新针对 ChatGPT 的 Chat 体验,Work 与 Codex 的模型没有随之更换。这个范围很关键:它属于面向日常对话的模型与产品更新,不能据此推断其他工作界面已经同步升级。产品公告、十月版本系统说明。

Intelligent UI 让回答可以包含按钮、表单、图表和可直接操作的工具。官方展示的例子包括交互式讲解、分账工具和储蓄计算器。它的实现有一个明确约束:模型使用原生组件库组织界面,编译器随生成过程逐步呈现;训练也包含对界面清晰度、用途与完整性的评估。实现介绍。

这会改变一部分问题的处理方式。以比较储蓄方案为例,一段文字只能说明给定条件下的结果;可调工具允许用户改变期限或投入,直接观察结果变化。用户不必每修改一个假设就重新描述整个问题,模型也不必反复生成大段相似解释。交互界面的收益来自减少往返、显露变量关系,让用户更容易检查自己究竟接受了哪些假设。

组件库则承担了另一种作用:把每次临时生成界面的设计空间限制在熟悉的部件之内。模型仍然决定展示什么、如何排列,但无需为每个问题重新发明按钮和表单。这种约束有助于保持使用习惯,也将产品能力的要求从“文字是否回答正确”扩展到“用户能否找到条件、调整条件并读懂结果”。

相应地,漂亮的界面会带来新的验证问题。计算器可能让数字显得更可信,图表可能让不确定关系显得更确定;用户操作顺畅,也不能证明底层公式、来源或默认值正确。应用评测因而需要覆盖交互过程:修改输入后结果是否一致,单位是否清楚,边界值是否处理,重要假设是否可见。这是从该产品形态推导出的要求,发布公告本身尚未提供足以判断这些真实使用表现的完整证据。

对应用公司的影响也应按具体任务判断。能够在对话中生成的分账、计算和解释工具,会降低轻量工具的制作与使用门槛;涉及长期数据、多人协作、业务权限和稳定流程的产品,仍需要额外的系统支持。Intelligent UI 展示出的竞争方向,是让模型同时决定答案内容与操作入口。未来相同的模型知识可以通过不同界面产生不同使用价值,产品设计与模型能力之间的关系会因此更紧密。