AI产品库

扩散式代码模型与补全接口 · 当前档位输入每百万 token 0.04 美元起、输出 0.15 美元起(限时折扣);补全档位 0.25 与 0.75 美元。

Inception Labs Mercury LogoMercury Coder

并行生成的扩散式代码模型

Mercury Coder 是 Inception Labs 的扩散式代码模型线:以并行生成替代逐字输出,提供行内补全与下一步编辑两个专用接口,另有可做工具调用与结构化输出的通用推理档位。

深度介绍

Mercury Coder详细介绍

🧭

定位:用扩散替代逐字生成

官方把 Mercury 定义为一类新的扩散式大语言模型:所有其他模型一次生成一个 token,而它并行生成 token,从而提升速度并最大化显卡利用率。官方给出的三项量化收益是首字延迟低于 300 毫秒、吞吐高出 5 到 7 倍、单任务成本最多降低 70%。公司口号是「每一毫秒都重要」,落点非常明确——它不是要拼最聪明,而是要拼最快与最便宜,这决定了它适合的位置是高频、低延迟、按次计费的场景。

流式输出也是按块给的

一个容易被忽略但很实用的差异:常规模型的流式输出是逐 token 推送,而它的流式输出是「按块」推送——每个块是模型解码过程中吐出的一段已经过精炼的文本,而不是一个字。官方还提供了一个「扩散可视化」模式,可以把噪点逐步收敛成最终文本的过程展示出来,用于演示与调试。对做聊天与实时应用的开发者,这意味着首屏可读内容出现得更早,体验上更像「整句浮现」而非「逐字打出来」。

💻

代码侧的两个专用接口

这条线在代码上给了两个不同用途的端点。行内补全接口接收光标前的代码作为前缀、光标后的代码作为后缀,返回中间应该补上的内容——这正是编辑器里逐字补全的标准形状。下一步编辑接口问的是另一个问题:这个文件接下来应该改哪里;它的输入是当前文件、可编辑区域、编辑历史与最近看过的代码片段,输出是预测性的多行改动。官方文档用一句对照把两者分开:前者回答「这两个已知点之间该放什么」,后者回答「接下来该改什么」。

🧩

通用档位与它搭配使用

补全与改写不是全部。官方当前的主力档位是一个通用推理模型,官方描述为面向快速聊天、智能体与结构化工作流,支持工具调用与结构化输出,长度与补全档位不同:它的对话上下文可达 260K、单次最大输出 65,536 个 token;补全档位专供补全与改写,上下文 32K、最大输出 8,192 个 token。实际用法通常是组合:补全走补全档位,需要推理、调工具或产出结构化结果的步骤走通用档位。

🔌

接入方式与生态

官方接口采用与主流格式兼容的形状,因此已有工具往往只需改服务地址与密钥就能接进来。文档提供了官方的 Python 与 TypeScript 开发包,安装命令是标准的包管理方式。此外官方列出了相当长的集成清单,覆盖编辑器、框架与语音平台;对做编辑器插件的人来说,这意味着一部分接入工作已经被验证过。官方还按场景给了多份「食谱」式教程,包括检索智能体、客服、语音、SQL 与编码智能体。

🎛

结构化输出与推理强度

扩散式生成的另一个好处是官方所说的「对输出有细粒度控制」:因为不是严格从左到右,模型更容易遵守指定的结构约束与语义约束,落到产品上就是结构化输出——可以直接产出符合给定结构的结果,喂给下游程序。文档里还单列了推理强度这一项,允许在延迟与质量之间按请求调节。对把模型当流程中的一个环节、而不是终点的人来说,这两项比基准分数更影响实际可用性。

为什么延迟能压这么低

官方解释得很直白:并行生成让显存利用更充分,因此同样的硬件能服务更多请求,单位成本随之下降。这也是「5 到 7 倍吞吐」与「最多降低 70% 成本」这两个数字的来源——它们本质上是一件事的两面。对按量付费的产品,这意味着同样预算可以多跑数倍的调用;对自建推理的团队,则意味着同样的卡能扛更高的并发。反过来,它对单次复杂推理的深度并不是主打,官方把它定位为速度优化的前沿级质量,而非最强推理。

📌

取用前要知道的两点

第一,价格页显示的折扣是限时的,官方用「立省八成」标注在模型表上方,因此核对时应以当时的价格页为准,不要按折扣价长期做预算。第二,这条线目前只处理文本,不支持图像输入;如果需求是多模态理解,应当另找模型。另外官方团队背景里提到成员来自多所高校与头部研究机构,并称产品已在大型企业部署;这类自我描述只作为背景参考,不作为能力证明。

产品特点

核心功能与独有价值

01

并行生成把延迟压到 300 毫秒内

官方称首字延迟低于 300 毫秒、吞吐高出 5 到 7 倍、单任务成本最多降 70%。这三个数字是一件事的三面:并行生成让显存利用更充分,于是单位时间能服务更多请求,延迟与成本同时下降。

02

补全和改写是两个不同的接口

它没有把「补全」和「改代码」混在一个接口里:补全端点用前缀加后缀问「中间该放什么」,改写端点用当前文件、可编辑区域与编辑历史问「接下来该改哪里」。对做编辑器的团队,这两个问题需要的数据完全不同,分开更省事。

03

流式按块而非按字返回

它的流式输出一次推送一段已精炼的文本,而不是一个 token 一个 token 地挤。聊天与实时语音场景里,用户更早看到可读内容,体验差别明显;官方还提供可视化模式展示去噪收敛过程。

04

扩散带来更听话的结构约束

因为不是严格从左到右生成,官方称模型更容易遵守指定的结构与语义约束,落到实处就是结构化输出更稳定。对把模型输出直接交给下游程序的流程,这比多几分基准分更实用。

最近动态

重要更新

九月核验:当前档位与折扣状态

核验时官方文档把当前主力档位标注为最新一代推理模型,并在模型表上方用「立省八成」标注限时折扣,三项价格分别为输入每百万 token 0.04 美元、缓存输入 0.004 美元、输出 0.15 美元。同一表格里另列出一个上一代通用档位与一个补全档位。由于折扣是限时的,本页价格按核验当日的公开数字记录,并注明应以价格页为准。

九月核验:能力面覆盖补全与改写

文档的能力清单包含流式与扩散、工具调用、结构化输出、行内补全与下一步编辑五类,并把补全与改写明确拆成两个端点、用一张对照表说明各自回答的问题与输入项。官方同时提供 Python 与 TypeScript 开发包、多份场景教程,以及覆盖编辑器与框架的集成清单,说明这套接口已按生产接入的方式整理过。

更早:扩散式代码模型首次公开

这条线最早是作为面向代码的扩散式模型公开的,当时的卖点就集中在速度与成本:用并行生成替代逐字生成,在代码补全与生成任务上给出远高于同级的吞吐。后续版本把能力扩展到通用推理、工具调用与结构化输出,并补齐了补全与改写两个专用接口,逐步从「一个快模型」演化成一条完整的开发者接口线。

产品总结

Mercury Coder 是 Inception Labs 的扩散式代码模型线。官方把 Mercury 定义为一类新的扩散式大语言模型:所有其他模型一次生成一个 token,而它并行生成,从而提升速度并最大化显卡利用率。官方给出的三项量化收益是首字延迟低于 300 毫秒、吞吐高出 5 到 7 倍、单任务成本最多降低 70%,公司口号是「每一毫秒都重要」,定位非常明确——拼速度与成本,而不是拼最强推理。 代码侧它给了两个不同用途的端点。行内补全接口接收光标前的代码作为前缀、光标后的代码作为后缀,返回中间该补上的内容,这正是编辑器逐字补全的标准形状;下一步编辑接口问的是另一个问题——这个文件接下来该改哪里,输入是当前文件、可编辑区域、编辑历史与最近看过的代码片段,输出是预测性的多行改动。官方用一句对照把两者分开:前者回答「这两个已知点之间该放什么」,后者回答「接下来该改什么」。补全档位的上下文为 32K、最大输出 8,192 个 token。 通用档位则是另一条腿:官方当前主力是一个通用推理模型,面向快速聊天、智能体与结构化工作流,支持工具调用与结构化输出,对话上下文可达 260K、单次最大输出 65,536 个 token。实际用法通常是组合——补全走补全档位,需要推理、调工具或产出结构化结果的步骤走通用档位。扩散式生成还带来一项官方强调的好处:因为不是严格从左到右,模型更容易遵守指定的结构与语义约束,结构化输出因此更稳定;文档另单列了推理强度,允许按请求在延迟与质量之间调节。 接口体验上有一个值得注意的差异:它的流式输出是「按块」推送,每块是一段已精炼的文本而不是单个 token,另有可视化模式可展示去噪收敛过程。接入方面,官方接口采用与主流格式兼容的形状,已有工具往往只需改服务地址与密钥;文档提供官方 Python 与 TypeScript 开发包、覆盖编辑器与框架的集成清单,以及检索、客服、语音、SQL 与编码智能体等多份场景教程。 价格方面,核验当日官方价格页把当前主力档位标为输入每百万 token 0.04 美元、缓存输入 0.004 美元、输出 0.15 美元,并注明是限时折扣;补全档位与上一代通用档位为输入 0.25 美元、缓存 0.025 美元、输出 0.75 美元。需要留意折扣是限时的,做预算时应以当时价格页为准。此外这条线目前只处理文本,不支持图像输入。

产品类型
扩散式代码模型与补全接口
支持平台
云端接口(兼容主流接口格式) / 行内补全专用端点(FIM) / 下一步编辑端点(Next Edit) / 官方 Python 与 TypeScript 开 / 第三方编辑器与框架集成
资费模式
当前档位输入每百万 token 0.04 美元起、输出 0.15 美元起(限时折扣);补全档位 0.25 与 0.75 美元。

核验信息

参考文章与数据来源

本页事实来自官方渠道:官网首页(扩散式模型的定位、并行生成与显卡利用率的解释、首字延迟与吞吐与成本三项数字、公司口号、结构化约束与多模态前景、团队背景与部署规模的自我描述),以及官方文档(当前主力档位与上一代档位与补全档位的价格与缓存价格与端点与上下文与最大输出与特性、开发包与安装方式、行内补全与下一步编辑的定义与输入项与对照表、流式按块推送与扩散可视化、结构化输出与工具调用与推理强度、集成清单与场景教程)。页内未列出官网与文档中出现的第三方品牌与机构名称。价格与状态核验于 2026 年 9 月 22 日。

  1. 官网Inception Labs 官网
  2. 官方文档官方文档首页
  3. 官方文档模型与价格
  4. 官方文档行内补全(FIM)文档
  5. 官方文档下一步编辑文档
  6. 官方文档流式与扩散模式
  7. 官方文档结构化输出
  8. 官方文档官方开发包与接入

用户体验调查

Mercury Coder介绍页面对您是否有帮助?