同步自 OpenRouter · 400 个模型 · source=openrouter · 2026-08-10T01:43:02.275Z
Mercury 2
inception/mercury-2
Inception: Mercury 2 是 Inception Labs 推出的首款推理扩散大语言模型(dLLM)。不同于传统自回归顺序生成,它通过并行产生并精炼多个 token,实现超过 1000 tokens/sec 的生成速度,比 Claude 4.5 Haiku 或 GPT-5 Mini 等速度优化模型快 5 倍以上,同时保持相当质量。支持 128K 上下文窗口、原生工具调用、可调推理深度和 schema-aligned JSON 输出。适用于 agentic workflows、实时语音交互、代码编辑、搜索 RAG 管道等对延迟敏感的生产环境。质量与速度优化前沿模型相当,但延迟极低,能在实时预算内提供推理级输出。以厂商/网关为准。
首款推理扩散LLM,>1000 tps高速并行生成,适合实时生产场景。
mercury-2
Inception · 知识库 159 模 / 31 族
首款推理扩散LLM,>1000 tps高速并行生成,适合实时生产场景。
Inception: Mercury 2 是 Inception Labs 推出的首款推理扩散大语言模型(dLLM)。不同于传统自回归顺序生成,它通过并行产生并精炼多个 token,实现超过 1000 tokens/sec 的生成速度,比 Claude 4.5 Haiku 或 GPT-5 Mini 等速度优化模型快 5 倍以上,同时保持相当质量。支持 128K 上下文窗口、原生工具调用、可调推理深度和 schema-aligned JSON 输出。适用于 agentic workflows、实时语音交互、代码编辑、搜索 RAG 管道等对延迟敏感的生产环境。质量与速度优化前沿模型相当,但延迟极低,能在实时预算内提供推理级输出。以厂商/网关为准。
Mercury 2 is an extremely fast reasoning LLM, and the first reasoning diffusion LLM (dLLM). Instead of generating tokens sequentially, Mercury 2 produces and refines multiple tokens in parallel, achieving...
- 首款推理扩散LLM,>1000 tps高速并行生成,适合实时生产场景。
- 归并版本 1 个
- Mercury 2 为 Mercury 系列第二代推理增强版,采用扩散架构而非自回归,上下文 128K。
适用场景
- 实时语音与交互
- 代码自动补全与编辑
- Agent 多步循环
- 搜索 RAG 与多跳检索
- 高并发低延迟生产部署
能力 / 优势
- 高速并行扩散生成
- 可调推理深度
- 原生工具调用
- 结构化 JSON 输出
- 高吞吐量实时响应
边界 / 不适合
- 需要顶级智能的极复杂推理任务
- 长篇创意写作或叙事生成
接入提示:OpenRouter 接入,OpenAI 兼容 API,短 ID inception/mercury-2,支持 reasoning_effort 参数;测速入口 openrouter.ai/inception/mercury-2 playground。
常见问题
Mercury 2 采用什么生成架构?
扩散大语言模型(dLLM),并行生成并精炼 token,实现极高速度。
适合哪些场景?
实时交互、Agent 循环、代码辅助和低延迟生产 AI。
上下文和定价如何?
128K 上下文,OpenRouter 上输入 $0.25/1M,输出 $0.75/1M。
历史版本 / 相关变体
| 版本 | 模型 | 参数 | 来源 | 说明 |
|---|---|---|---|---|
| —当前 | Mercury 2 inception/mercury-2 | — | OpenRouter |
定价与限制
| 输入 | $0.250 / 百万 tokens |
| 输出 | $0.750 / 百万 tokens |
| 缓存读 / 写 | $0.025 / — |
| 最大输出 | 50k |
| 输入模态 | text |
| 输出模态 | text |
| HF | — |
支持参数
价格与基准分优先同步自 OpenRouter;网关短 ID 由本站平台清单补全,介绍/历史版本融合 Hugging Face 检索与家族知识库。能力验真请用 bench_v1 实验室 · OCR 天梯。
About this entity
Mercury 2: how to use this page
Mercury 2: live quotes and risk signals on GrokCode. Aggregation only — not a storefront.
Use related guides for methodology; use the tables above for numbers that change hourly.
Related guides
- 2026 Grok 编码模型天梯:性价比与选型实战榜 — 聚焦Grok Build 0.1编码代理天梯,实测多场景性价比、上下文长度与工具调用稳定性;对比主流模型,提供工程选型清单与硬件适配建议。
- 2026 GrokCode vLLM 本地部署生产清单:并发、显存、量化与模型天梯实战 — vLLM本地部署生产级配置全指南,聚焦并发处理能力、显存优化、量化策略与编码模型天梯性价比对比。结合GrokCode实验室实测数据,提供工程可核验的硬件搭配方案
- Grok / xAI 模型天梯在 vLLM 本地部署的性价比排行榜 — 2026年 GrokCode 模型天梯在 vLLM 本地部署场景下的编码模型排行榜,覆盖 70B 级 TCO 实测、量化策略与业务选型路径。
- 本地部署 70B 模型天梯:TCO 实测与电费卡费量化 — GrokCode 针对 70B 级别本地部署的算力账单化方案,涵盖电费、硬件卡费、量化策略实测数据与 vLLM 生产清单,助力模型天梯性价比选型。
- 编码模型天梯怎么读:Grok 4.5 性价比榜与业务选型实战 — 2026 年最新 Grok 4.5 / Grok 4.20 编码模型天梯拆解:BenchAlign v5、LM Arena、HighWalk 实测数据 + 与
- 2026 模型天梯实测:DeepSeek R1、Qwen3、Grok 4、Claude Opus 5 工程选型指南 — 基于最新基准与真实 API 延迟、成本、编码/推理表现,构建 2026 年中转与本地混合部署的模型天梯。包含量化对比表、场景推荐及避坑清单,帮助开发者快速定位最
- 2026 本地推理模型天梯:7B-70B GPU 量化部署与 TCO 实测指南 — 基于 2026 年最新开源模型基准,构建从 4B 到 70B 参数的本地部署天梯。包含 RTX 5090/4090 实测吞吐、4bit/8bit 量化策略、vL
- 编码模型天梯怎么读:性价比榜与业务选型 — GrokCode 品牌专题:编码模型天梯怎么读:性价比榜与业务选型。 锚点:天梯。
FAQ
- Where do Mercury 2 prices come from?
- From public catalogs and lab snapshots. Prefer official pages for final billing truth.
Topic hubs
slug:inception/mercury-2 · methodology hubs ≠ live prices
Related tools
Clavue CLI / imux IDE / clavue-2.1
Clavue · CLI 与 Agent 平台
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗imux · 原生 macOS AI IDE
Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗Clavue 2.1 · 产品级大模型
旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗