选出真正“会查资料”的境内 AI 信息入口
本评测不比较谁更会写漂亮答案,而比较谁能在高时效、跨产品、跨价格体系的问题上主动检索、优先采用一手来源、正确处理冲突,并在证据不足时克制地说“不确定”。
工作方式
在Web平台提问,得到答案并保存。选定评分平台。每次上传 1 份 Markdown 答案 。评分平台审阅后综合评价,内容包括:摘要、事实错误、遗漏、来源质量、价格计算、模型/套餐分类、幻觉风险、总分与评语。
为什么采用逐份匿名评测?
每份回答都很长,而且很多事实需要重新访问官方页面核对。逐份处理能让每一次核查都有明确边界,也方便把新发现的官方事实反向补进“事实核查基准”,避免后面的答案因为基准过旧而被误判。
完整测试题
事实核查基准 v0.1
这是“动态基准”,只记录已经由当前官方资料或高可信一手资料钉死的事实。未确认项目宁可留空。随着 24 份回答逐一审阅,基准将继续扩充并记录冲突。
已核验锚点
| 对象 | 截至 2026-08-24 的核验事实 | 状态 |
|---|---|---|
| 汇率 | 中国外汇交易中心 2026-08-24 人民币汇率中间价:1 USD = 6.7841 CNY。本评测的美元价格统一用此汇率折算。 | 已核验 |
| OpenAI | GPT‑5.6 系列当前包括 Sol / Terra / Luna。官方 7 月 30 日公告:Terra 标准 API 为 $2 输入 / $12 输出每 1M tokens,Luna 为 $0.20 / $1.20;Sol 价格保持不变,API 定价页列短上下文标准价 $5 / $30。 | 已核验 |
| Anthropic | Claude Sonnet 5 已发布并可用,至 2026-08-31 的介绍价为 $2 输入 / $10 输出每 1M;之后 $3 / $15。Anthropic 2026-05-27 价表同时列出 Claude Opus 4.8,标准 API $5 / $25。回答若把“最新一代”和“最高端旗舰”混成一个概念需说明。 | 已核验 |
Google 官方截至 2026-08-24 已将 Gemini 3.7 Flash 设为 GA,Model ID gemini-3.7-flash,1M context;截至 2026-12-31 标准 API 促销价为 $0.75 输入 / $3.75 输出每 1M。Gemini 3.6 Flash 同期也执行相同促销价。Gemini 3.1 Pro 仍标记为 Preview,≤200K 标准价 $2 / $12。 | 已核验 | |
| DeepSeek | 官方 API 当前列 DeepSeek‑V4‑Flash 与 DeepSeek‑V4‑Pro,均 1M context。缓存未命中输入分别 ¥1 / ¥3 每 1M,输出 ¥2 / ¥6。 | 已核验 |
| Kimi | Kimi Chat 当前可选 K2.6 / K3 / K3 Cluster;K2.6 聊天入口免费且不消耗会员额度。最低会员 Andante ¥49/月,含约 30 次 Agent、Deep Research、Office、Kimi Code、1000 次专业数据库调用等;会员功能共享额度池。 | 已核验 |
| GLM | 智谱官方开放文档当前仍将 GLM‑5.2 标为“最新旗舰模型”。但 OpenCode Go 的官方页面列出了 GLM‑5.3。两者存在值得核查的口径差异,不能仅凭第三方/Provider 名称断言“GLM‑5.3 是智谱官方当前旗舰”。 | 官方口径冲突/待解释 |
| OpenRouter | 统一 API 聚合平台;Pay‑as‑you‑go 对底层 Provider 推理价不加价,但购买 credits 收 5.5%(最低 $0.80)费用。支持多 Provider、自动路由与 fallback;免费模型有较低限流。 | 已核验 |
| OpenCode Go | OpenCode 官方:首月 $5,之后 $10/月;是低成本 Coding 模型订阅,不是基础模型。会提供 Go API key,并有 OpenAI/Anthropic-compatible endpoints;官方写明可用于 any agent。当前列表含 Grok 4.5、GLM-5.3/5.2、GPT 5.6 Luna、Kimi K3、Qwen3.8 Max、DeepSeek V4 等。 | 已核验 |
| Agnes | 目前检索到 AgnesAI-Labs / Agnes-AI 项目公开套餐与 OpenAI-compatible API 信息,但“官方商业产品身份、当前正式价格与模型版本”还需要在审阅相关回答时继续做一手来源确认。 | 待进一步核验 |
| Qwen / 豆包 / 混元 / 文心 / MiniMax / SiliconFlow / xAI | 暂不在 v0.1 为了填满表格而硬写。将在逐份审阅中按回答涉及的具体模型、套餐和 Provider 精确核查。 | 待核验 |
当前官方来源
- OpenAI · GPT‑5.6 availability and pricing
- OpenAI API Pricing
- Anthropic · Claude Sonnet 5
- Claude plans & pricing
- Google Cloud generative AI pricing
- Gemini Apps limits & upgrades
- DeepSeek API · 模型与价格
- Kimi · 会员价格与权益
- Kimi · K2.6 / K3 / K3 Cluster
- 智谱 · 模型概览
- OpenRouter FAQ / Fees
- OpenCode Go 官方文档
- 2026-08-24 人民币市场汇价(新华社转中国外汇交易中心)
单份回答评分规则 · 100 分
模型版本、会员价、API价、套餐性质、Provider 关系。
是否真正查到 2026-08-24,而不是旧知识。
官方价格页/文档/公告优先;二手源只作补充。
链接存在不等于引用成立;必须真正支持对应结论。
是否完成题目要求,并正确区分 Chat/API/Coding/聚合平台。
查不到能否明确说“未确认”,而不是补全。
汇率、1M token、缓存未命中、同模型同版本比较是否正确。
严重扣分项
- 伪造模型、套餐、官方页面或价格。
- 把 Chat 会员额度当普通 API 余额。
- 把缓存命中价 / Batch 折扣当常规输入价。
- 把不同版本、量化版、Flash/Pro 等放在同一“同模型”价格组直接比较。
- 明确给出过时数据,却声称“截至 2026-08-24 最新”。
- 引用页面与结论不匹配,尤其是拿第三方营销稿覆盖官方文档。
参考答案
这不是“唯一正确措辞”,而是一份用于对照评分的标准作答:优先采用官方一手资料,严格区分 Chat 产品、API、Coding Plan、聚合平台和第三方 Provider;无法由官方资料确认的项目明确保留不确定性,不为了填满表格而猜测。
一、先给结论
- 全球通用研究入口:ChatGPT / Gemini / Claude 等产品必须与其开发者 API 分开看;个人订阅通常不等于普通 API 余额。
- 中国平台:DeepSeek、Kimi、Qwen、GLM、豆包、混元、文心、MiniMax 等要分别核对 Chat、开放平台 API、Coding Plan / Token Plan,不能把“会员”与“API 充值”混为一谈。
- 模型比较必须先锁定模型身份:只有 model ID / 名称 / 版本一致,才能做官方、OpenRouter、SiliconFlow、云厂商之间的同模型价格比较。Flash / Pro、Turbo / Lite、蒸馏、量化、旧版本都不能混为“同模型”。
- 汇率统一:本评测按 2026-08-24 中国外汇交易中心人民币汇率中间价,1 USD = 6.7841 CNY。
二、截至 2026-08-24 的主要模型状态
| 厂商 | 当前应识别的模型/层级 | 状态与注意事项 |
|---|---|---|
| OpenAI | GPT-5.6 Sol / Terra / Luna | Sol 为旗舰层级;Terra、Luna 为更低成本层级。回答必须区分 ChatGPT 内可用模型与 API model。 |
| Anthropic | Claude Fable 5;Mythos 5 | Fable 5 为公开可用高端层级;Mythos 5 为受限层级。不能把“公开可用最高层级”和“受限最高层级”混写。 |
| Gemini 3.7 Flash;Gemini 3.1 Pro | 3.7 Flash 已 GA;3.1 Pro 仍为 Preview。正式版与 Preview 必须分开。 | |
| xAI | Grok 4.6 | 长上下文存在分段价格,不能只写单一输入/输出价而不说明上下文档位。 |
| DeepSeek | DeepSeek-V4-Flash / V4-Pro | 当前 API 主力;旧的 deepseek-chat / deepseek-reasoner 已不应继续作为“当前主模型”锚点。 |
| Kimi | K2.6 / K3 / K3 Cluster | K2.6 Chat 免费且不消耗会员额度;会员、Kimi Code 与 API 需分别讨论。 |
| Qwen | Qwen3.8 Max 等当前代模型 | 需要按官方具体 model ID 核对;不能将旧 Qwen3.x 版本直接当作当前旗舰。 |
| 智谱 | GLM-5.3 | 当前代旗舰 / Coding 主力;中国开放平台价格与国际 Z.ai 价格可能不同,必须注明使用哪套官方价格体系。 |
| 腾讯混元 | Hy3 | 应按腾讯官方 API / 控制台的具体 model ID 与价表核验。 |
| 百度文心 | ERNIE 5.1 | 存在上下文档位差异,需按官方价表写明。 |
| MiniMax | MiniMax M3 | 长上下文存在分段价格与缓存价,标准比较应使用缓存未命中输入价。 |
| 豆包 | Doubao 2.1 / Seed 系列 | 需按火山方舟当前 model ID 与价格页核验;不要用旧 Seed 2.0 代替当前代。 |
| Agnes | Agnes 2.5 Pro Alpha / 2.5 Flash | 既有自有模型,也有 Agent / Chat 产品和 OpenAI-compatible API;不能简单归类成纯聚合壳。 |
三、个人订阅与 API:必须分开
| 产品 | 最低主要个人付费 | 关键权益 | 是否等于普通外部 API 余额 |
|---|---|---|---|
| ChatGPT | Plus:$20/月 | 更高模型/消息限额、研究与产品功能等 | 否。ChatGPT Plus 不包含可在 OpenAI Platform 随意调用的普通 API 余额。 |
| Claude | Pro:$20/月;$200/年 | 更高使用限额与高端模型访问 | 否。Claude Pro 与 Anthropic Console API 计费分离。 |
| Kimi | Andante:¥49/月 | 约 30 次 Agent、Deep Research、Office、Kimi Code、专业数据库调用、项目与存储等 | 否。会员额度不应写成 Moonshot 普通 API 余额。 |
| GLM Coding Plan | Lite:标价 ¥118/月;当前活动价 ¥94.4/月 | 10,000 Credits / 周;滚动接入最新旗舰模型,支持 20+ Coding Agent / IDE | 不能直接等同。使用 Coding 专用 endpoint,与通用 BigModel API 余额和 endpoint 分离。 |
| OpenCode Go | 首月约 ¥33.92,之后约 ¥67.84/月 | 面向 Coding Agent 的多模型订阅,可获得 Go API key / compatible endpoints | 不是原厂通用 API 余额。但官方允许用于 OpenCode 或其他兼容 Agent。 |
四、代表性官方 API 价格
以下统一优先写“标准、缓存未命中、非 Batch”的 1M token 价格。美元计价项目按本页基准汇率 1 USD = 6.7841 CNY 换算为人民币,结果四舍五入至分。若存在促销且在 2026-08-24 正在生效,应按当前实际可用价列出,并标注促销期限。
| 模型 | 输入 / 1M(人民币) | 输出 / 1M(人民币) | 重要备注 |
|---|---|---|---|
| GPT-5.6 Sol | ¥27.14 | ¥135.68 | 2026-08-21 起的阶段性降价;缓存输入另计。标准答案应识别当前生效价,而不是继续使用旧价约 ¥33.92 / ¥203.52。 |
| GPT-5.6 Terra | ¥13.57 | ¥81.41 | 更低成本层级。 |
| GPT-5.6 Luna | ¥1.36 | ¥8.14 | 低成本层级。 |
| Claude Fable 5 | ¥67.84 | ¥339.21 | 公开可用高端层级。 |
| Gemini 3.7 Flash | ¥5.09 | ¥25.44 | 当前促销价截至 2026-12-31;缓存输入约 ¥0.51 / 1M。 |
| DeepSeek-V4-Flash | ¥1.5 低谷 / ¥3 高峰 | ¥4.5 低谷 / ¥9 高峰 | 需明确峰谷时段;不能只挑最低价做“标准价格排名”。 |
| DeepSeek-V4-Pro | ¥4.5 低谷 / ¥9 高峰 | ¥13.5 低谷 / ¥27 高峰 | 同上。 |
| GLM-5.3 | 中国官方价格体系应按 BigModel 当前价表核验 | 同左 | 不要拿 Z.ai 国际美元价冒充中国官方人民币价。 |
| ERNIE 5.1 | ≤32K:¥4;32K–128K:¥6 | ≤32K:¥18;32K–128K:¥22 | 存在上下文分档。 |
| MiniMax M3 | ≤512K:¥2.1;>512K–1M:¥4.2 | ≤512K:¥8.4;>512K–1M:¥16.8 | 当前折扣价;缓存价不能拿来当普通输入价。 |
| Agnes 2.5 Pro Alpha | ¥3.05 | ¥6.11 | OpenAI-compatible API,1M context。 |
| Agnes 2.5 Flash | 当前 ¥0 | 当前 ¥0 | 512K context;标准标价约 ¥0.20 / ¥1.02,但官方当前价为 $0 / $0。免费不等于无限量,仍以账户与 API Key 的速率限制、权限为准。 |
五、主要 LLM 在不同平台 / Plan 中的价格横向对比
先看完全相同模型 / 明确版本的 API 单价,再看该模型是否包含在月度 Plan 中。API 单价统一为 人民币 / 1M tokens(输入 / 输出);美元均按 1 USD = 6.7841 CNY 换算。月度 Plan 是受时间窗口、Credits、请求估算或公平使用约束的订阅,不能直接除成稳定 token 单价。
A. 同模型 / 同版本的 API 与 Plan 覆盖
| 模型 / 版本 | 原厂官方 API | OpenRouter | SiliconFlow | 可用月度 Plan(当前) |
|---|---|---|---|---|
| GPT-5.6 Sol | ¥27.14 / ¥135.68 | 活动价 ¥13.57 / ¥67.84 50% off;需核对活动结束时间 | 未列出完全同名 / 同 ID | 未在下列主流多模型 Coding Plan 中列出 |
| GPT-5.6 Terra | ¥13.57 / ¥81.41 | ¥13.57 / ¥81.41 | 未列出完全同名 / 同 ID | 未在下列主流多模型 Coding Plan 中列出 |
| GPT-5.6 Luna | ¥1.36 / ¥8.14 | ¥1.36 / ¥8.14 | 未列出完全同名 / 同 ID | OpenCode Go:月度约 10,250 次请求估算 |
| Claude Fable 5 | ¥67.84 / ¥339.21 | ¥67.84 / ¥339.21 | 未列出完全同名 / 同 ID | 未在下列主流多模型 Coding Plan 中列出 |
| Gemini 3.7 Flash | 活动价 ¥5.09 / ¥25.44 | 特定路由活动价最低 ¥2.54 / ¥12.72 Google Vertex 路由 75% off;其他路由可能为 ¥5.09 / ¥25.44 | 未列出完全同名 / 同 ID | 未在下列主流多模型 Coding Plan 中列出 |
| DeepSeek-V4-Flash | 低谷 ¥1.5 / ¥4.5 高峰 ¥3 / ¥9 | 0731:活动价约 ¥0.27 / ¥0.54;DeepSeek 直供约 ¥1.49 / ¥4.48 | deepseek-ai/DeepSeek-V4-Flash¥1 / ¥2 | OpenCode Go:月度约 37,800 次请求估算 |
| DeepSeek-V4-Pro | 低谷 ¥4.5 / ¥13.5 高峰 ¥9 / ¥27 | 0813 当前聚合约 ¥4.25 / ¥12.76;DeepSeek 直供约 ¥4.48 / ¥13.43 | deepseek-ai/DeepSeek-V4-Pro¥12 / ¥24 | OpenCode Go:月度约 5,200 次请求估算 |
| Kimi K2.6 | 应按 Moonshot 当前 model ID / 价表核验 | 未在本表冻结可严格核对的同 ID 报价 | Pro/moonshotai/Kimi-K2.6¥6.5 / ¥27;带 Pro 前缀,不能直接视为原厂同 ID | OpenCode Go:约 5,750 次/月;Kimi 会员含 Kimi Code,但使用 kimi-for-coding 动态映射模型 |
| GLM-5.3 | 中国通用 API 价应按 BigModel 当前价表核验 | 未在本表冻结可严格核对的同 ID 报价 | 当前公开价表仅列 GLM-5.2,不能替代 5.3 | OpenCode Go:约 1,080 次/月;GLM Coding Plan滚动接入旗舰模型 |
| Qwen3.8 Max | 应按 QwenCloud / 阿里云当前 model ID 核验 | 未在本表冻结可严格核对的同 ID 报价 | 未列出完全同名 / 同 ID | OpenCode Go:约 810 次/月;Qwen Token Plan明确包含 Qwen3.8-Max |
| MiniMax M3 | ≤512K:¥2.1 / ¥8.4;长上下文另档 | 未在本表冻结可严格核对的同 ID 报价 | 仅列 MiniMax-M2.5,不能替代 M3 | OpenCode Go:约 16,000 次/月;MiniMax Token Plan约 1.7B–12.5B M3 tokens/月 |
Agnes 2.5 Flashagnes-2.5-flash | 当前 ¥0 / ¥0 标准标价约 ¥0.20 / ¥1.02 | 未列出完全同名 / 同 ID | 未列出完全同名 / 同 ID | 无需月费;免费 API 仍受账户 / API Key 限流与权限约束 |
B. 主流 Coding / Token Plan 月费与覆盖
| 平台 / Plan | 月费(人民币) | 主要模型覆盖 | 额度口径 | 能否接入其他工具 |
|---|---|---|---|---|
| OpenCode Go | 首月约 ¥33.92 之后约 ¥67.84 | GPT-5.6 Luna、GLM-5.3、Kimi K3 / K2.7 Code / K2.6、MiniMax M3、Qwen3.8 Max、DeepSeek V4 Pro / Flash、Hy3 等 | 约 ¥81.41 / 5h、¥203.52 / 周、¥407.05 / 月的内部美元价值上限;请求数按模型估算,不是固定 token 包 | 可以。Go API key + OpenAI / Anthropic-compatible endpoints;不是原厂 credit |
| Kimi 会员 / Kimi Code | Andante ¥49 Moderato ¥99 Allegretto ¥199 Allegro ¥699 | Kimi Code 使用固定 ID kimi-for-coding,后端自动更新;K2.6 Chat 免费且不消耗会员额度 | Agent、Deep Research、网站、Office、Kimi Code 等共享会员额度池;具体消耗按 token / 功能计算 | 可接第三方 Coding Agent。但会员额度不是 Moonshot 通用 API 余额;高速模式需更高档会员 |
| GLM Coding Plan | Lite:活动价 ¥94.4(标价 ¥118) Pro:¥430.4(标价 ¥538) Max:¥862.4(标价 ¥1,078) | 滚动接入最新 GLM 旗舰;官方当前说明含 GLM-5.3 / 5.2 等 | Lite 10,000 Credits / 周;Pro 为 6× Lite;Max 为 14× Lite | 可以。支持 20+ Agent / IDE,但须走 Coding 专用 endpoint,与通用 API 分离 |
| Qwen Token Plan | Individual 低至约 ¥40.70($6/月) | 明确包含 Qwen3.8-Max,并统一覆盖文本、视觉、语音、图像等模型 | Lite / Standard / Pro;Standard 为 Lite 4× Credits,Pro 为 Lite 16×;具体促销价和 Credits 以订阅页登录后为准 | 可以。提供 API key / Base URL,兼容 OpenAI、Anthropic 协议及主流 Coding 工具 |
| MiniMax Token Plan | Plus 约 ¥135.68($20) Max 约 ¥339.21($50) Ultra 约 ¥814.09($120) | MiniMax M3 / M2.7 / 图像 / 语音 / 音乐,共享额度 | 约 1.7B / 5.1B / 12.5B M3 tokens/月;另有并发、公平使用与时间窗口约束 | 可以。面向日常交互式 Agent / Coding 工具;不应当作无约束生产 API 余额 |
六、Model-first 的同模型 Provider 比较
正确做法不是先比较“平台谁便宜”,而是先锁定一个完全相同的模型 ID / 版本,再看不同 Provider 的实际价格、缓存、上下文、附加费、限流与大陆可用性。
| 检查项 | 标准 |
|---|---|
| 模型身份 | 名称、版本、model ID 一致;不接受“同一家族”替代“同模型”。 |
| 输入价 | 使用标准缓存未命中输入价;不使用 cached input / Batch 作为主排名。 |
| 输出价 | 按相同单位 1M tokens 比较。 |
| 上下文 | 确认 Provider 是否裁剪上下文、输出长度或工具能力。 |
| 版本差异 | 量化、蒸馏、Flash / Turbo / Lite、旧日期版本必须单列。 |
| 最终成本 | 再叠加充值手续费、汇率、税费、最低充值、余额有效期。 |
七、OpenRouter
- 本质:统一 LLM API gateway / marketplace,不是单一模型厂商。
- 模型推理价格通常按底层 Provider 标价透传,不是额外加 5.5% 推理 markup。
- 购买 credits 收 5.5% 手续费,最低 $0.80;加密货币充值约 5%。
- 支持 provider routing、locking、fallback、BYOK。
- BYOK:每月前 1M requests 免费,之后按等价模型 / Provider 成本收约 5%。
- 免费模型有日请求限制;累计购买一定 credits 后免费模型日限额会提高。
- credits 可能在长期未使用后到期,因此“标价”与“最终实际成本”应分开写。
八、SiliconFlow
- 本质:聚合推理平台 / 模型服务平台,提供 OpenAI-compatible API。
- 对中国大陆用户通常在网络、支付与国产模型覆盖方面更友好。
- 必须逐个核对模型是否为原始模型,还是量化 / 蒸馏 / Turbo / Lite / 平台改版。
- 与官方 API 做比较时,只有模型身份完全一致才可直接比较价格。
- 促销价、赠送额度、免费层与限流应单独列出,不应拿来替代标准长期价格。
九、OpenRouter vs SiliconFlow
| 维度 | OpenRouter | SiliconFlow |
|---|---|---|
| 定位 | 全球多 Provider 路由 / marketplace | 中国友好的聚合推理与模型服务平台 |
| 模型广度 | 全球闭源 + 开源覆盖非常广 | 国产 / 开源模型覆盖强 |
| 费用 | 模型价透传;credits 购买费 5.5% | 按平台价表,需逐模型核对 |
| 大陆网络 / 支付 | 通常不如境内平台便利 | 通常更友好 |
| 路由能力 | Provider routing / locking / fallback 强 | 更偏统一国内推理平台体验 |
| 适合 | 跨 Provider、全球模型、统一路由 | 中国用户、国产 / 开源模型、低门槛兼容 API |
十、OpenCode Go
- 不是模型,而是面向 Coding Agent 的低价模型订阅。
- 官方价格:首月 $5,之后 $10/月。
- OpenCode 本体免费;Go 是可选模型额度方案。
- 官方明确写明 “Use with any agent”,因此不应回答成“只能在 OpenCode 内使用”。
- 它会提供 Go API key / OpenAI-compatible 或 Anthropic-compatible endpoint,可用于兼容 Agent。
- 但它仍然不是 OpenAI、Anthropic、Kimi、DeepSeek 等原厂账户里的普通 API 余额,也不能把 Go 额度“转移”到原厂账户。
- 套餐的请求数 / 5h 是按不同模型估算,不等于固定 token 包;还会受公平使用、动态限流和模型成本影响。
十一、Agnes
- 应先识别为有自有基础模型 + Agent 产品 + API的 AI 公司 / 平台,而不是简单的第三方 Chat wrapper。
- Agnes 2.5 Pro Alpha:model ID
agnes-2.5-pro,OpenAI-compatible/v1/chat/completions/ Responses API,1M context。 - Agnes 2.5 Flash:512K context;官方当前 API 输入 / 输出均为 ¥0。标准标价约 ¥0.20 / ¥1.02,但免费调用仍受账户 / API Key 的速率限制和权限约束。
- 若某项会员价格 / 免费额度无法从 Agnes 官方页面确认,应明确写“未从官方公开资料确认”,不要从二手页面补全。
十二、实际成本怎么比较
- 先写官方 / Provider 的 sticker price。
- 统一按 1M 标准、缓存未命中输入 + 输出。
- 若美元计价,本评测统一按 6.7841 换算人民币。
- 再叠加充值费、平台费、信用卡 / 支付渠道、税费。
- 列明最低充值、余额有效期、是否需要预充值。
- 促销价必须注明有效期;不能拿已经结束的促销做当前排名。
十三、最终推荐逻辑
| 需求 | 优先选择 | 理由 |
|---|---|---|
| 全球最新 AI / API / 产品研究 | ChatGPT 等具备强检索与官方文档追踪能力的研究入口 | 重点看证据链、一手来源、Help / Pricing / API 文档命中率,而不是只看基座模型名。 |
| 中国大陆公开网页 / 中文厂商 / 本地生态 | 元宝 / DeepSeek / Kimi 等中国平台中实测检索较强者 | 更容易覆盖境内网页、政策、厂商公告与中文社区。 |
| 统一全球模型 API | OpenRouter | 全球 Provider 路由、fallback、BYOK 与模型广度。 |
| 中国友好聚合 API | SiliconFlow | 网络 / 支付 / 国产和开源模型覆盖更友好。 |
| 低成本 Coding Agent | OpenCode Go / GLM Coding Plan 等 | 按 Agent 场景购买额度,不能与普通 API 充值混为一谈。 |
十四、标准答案最重要的“不要做”
- 不要因为产品名熟悉,就凭旧知识写“截至 2026-08-24 最新”。
- 不要把 Chat 会员写成普通 API credit。
- 不要拿 cached input / Batch / 峰谷最低价冒充标准输入价。
- 不要把不同版本、不同模型后缀、量化版、蒸馏版直接当作同模型。
- 不要用第三方营销稿覆盖官方 Pricing / Model / Help 页面。
- 不要为了表格完整而补全无法确认的 Agnes、国产模型、套餐或 API 信息。
- 遇到官方口径冲突时,应该把冲突本身写出来,并说明哪个结论目前不能确定。
主要官方参考入口
- OpenAI API Pricing
- Anthropic 官方
- Gemini API Pricing
- DeepSeek API Pricing
- Kimi Help
- 智谱 BigModel 文档
- OpenRouter Docs
- OpenCode Go
- OpenRouter · OpenAI 实时 Provider 价格
- OpenRouter · DeepSeek 实时模型价格
- SiliconFlow Pricing
- Kimi 会员价格与权益
- QwenCloud Token Plan
- MiniMax Token Plan
- GLM Coding Plan
- Agnes 2.5 Flash 官方文档与价格
参考答案用于本评测的事实与方法对照;价格、模型状态和促销会继续变化,若将来复测,应重新按新的基准日更新。
聚类猜想:哪些回答可能属于同一类,甚至可能同源?
以下不是身份猜测,而是基于匿名回答的行为特征做聚类:搜索深度、来源纪律、最新事实召回、Provider比价方式、不确定性控制、是否做最终QC等。相同底模在不同平台/模式下可能跨簇;同一编号也可能同时具有两个簇的特征。
簇 A · 证据审计型
10 / 16 / 21
共同特征:官方优先、先判断证据等级再决定是否下结论、严格区分正式版与 Preview、Chat会员与API余额、同模型不同Provider。宁愿留空,也不愿伪造精确值。
强同源猜测:10 / 16 / 21 至少有两个可能来自同一底层模型家族;21尤其像10的更强检索/研究模式。
簇 B · 大规模搜集—长报告型
18 / 19 / 20 / 22
共同模式:先搭很大的研究框架,连续搜索大量厂商和价格页,输出长表格;国内模型覆盖积极;随着链路变长,容易逐渐混入第三方价格站、旧锚点或表格QC问题。
强同源猜测:18 / 19 / 20 / 22 里很可能有多个来自同一产品或同一家模型家族,只是模型档位/搜索模式不同。
簇 C · 广搜 Provider / 工程化研究型
05 / 07 / 09 / 13 / 17
共同特征:不仅找模型,还会继续往具体Provider、价格节点、第三方推理商、服务档位下钻;最新模型召回积极,数值很多,但也最容易把促销价、峰谷价、旧快照和不同Provider版本混到一起。
较强同源猜测:07 / 13 / 17 很可能更近;05 / 09 可能是邻近家族,也可能与前者属于更大的同源簇。
簇 D · 保守低召回型
08 / 11 / 16 / 24
共同点:不会就不说,幻觉控制明显高于平均水平。主要问题不是乱答,而是把不少实际上可以继续查清楚的事实提前判成未知。
可能的“同一底模不同工具权限”链条:11 → 24 → 16。
簇 E · 旧知识 + 报告生成型
02 / 03 / 06
共同点:表格和表达能力不差,但实时刷新弱。面对高速变化市场,容易用历史知识生成“看起来像当前”的报告。
可能同源程度:中等。它们未必同模型,但至少表现出相近的“基座知识强、实时检索弱”模式。
簇 F · 顾问 / 个性化型
12
12是明显离群点。它最突出的是能把用户长期背景、架构、安全边界和既有工具栈带入建议,个性化顾问感远强于其他回答。
独立性最高,但也最容易出现“底模其实相同、产品上下文层完全不同”的情况。
簇 G · 市场搜索 / 摘要型
14 / 15 / 23
共同点:会联网、信息量不小,但二手来源接受阈值高于“研究审计型”。更像搜很多网页后快速形成市场总结,而不是建立严格证据层级。
较强同源猜测:14 / 15 / 23 可能共享相近的Web Search + LLM Summary产品栈。
边缘 / 过渡型
01 / 04
01像受限搜索环境下的降级版本:会查,但资源不足后覆盖不足。04则是第一份真正进入候选池的“真实检索型”回答,介于基础搜索和成熟研究Agent之间。
强同源猜测(身份揭晓前)
| 猜测强度 | 可能同源编号 | 理由 |
|---|---|---|
| 很高 | 18 / 19 / 20 / 22 | 研究框架、长链路搜集、国内覆盖、后半段证据纪律松动方式高度相似。 |
| 很高 | 10 / 16 / 21 | 证据等级、官方优先、不确定性表达、Model-first纪律高度一致。 |
| 高 | 07 / 13 / 17 | Provider深挖、价格节点搜索、局部前沿但口径易混的特征接近。 |
| 中高 | 05 / 09 | 高召回、高覆盖、价格规则容易漂移;可能是簇C的邻近家族。 |
| 中高 | 14 / 15 / 23 | 二手来源接受度、搜索摘要式生成路径相似。 |
| 中 | 08 / 11 / 24 | 保守、安全、低召回;可能对应同一底模在不同搜索权限下的表现。 |
| 中 | 02 / 03 / 06 | 旧知识较强、实时检索较弱、报告生成能力大于事实刷新能力。 |
| 独立性高 | 12 | 个性化与长期上下文特征明显离群。 |
身份揭晓后最值得验证的三件事
- 同一模型跨平台,会不会比“不同模型同平台”更相似?
- 搜索工具/Research模式对最终质量的影响,是否大于底层模型本身?
- Deep Research / Pro / Thinking / 普通模式是否真的形成稳定可观察的能力层级?
这些结论比单纯“猜中品牌”更重要,因为它们直接关系到以后应该选模型、选平台,还是选搜索/研究模式。
身份揭晓:24 份回答的真实产品与模式
匿名评分、画像与聚类猜想全部保留不改。这里单独展示真实身份,用来检验:我们看到的究竟是底层模型指纹、平台指纹,还是搜索/研究模式指纹。
完整编号 → 产品/模式
| 编号 | 产品 | 入口 / 模式 | 域名 |
|---|---|---|---|
| 01 | 智谱清言 | 普通入口 | chatglm.cn |
| 02 | Z.ai Chat | 国际 Chat | chat.z.ai |
| 03 | BigModel Console | 开放平台控制台 | bigmodel.cn/console |
| 04 | Kimi | kimi.ai | www.kimi.ai |
| 05 | Kimi | kimi.com | www.kimi.com |
| 06 | 千问 | 中文 Chat | www.qianwen.com/chat |
| 07 | Qwen Chat | 国际 Chat | chat.qwen.ai |
| 08 | 豆包 | 默认 Chat | www.doubao.com/chat |
| 09 | Dola | Chat | www.dola.com/chat |
| 10 | 腾讯元宝 | 深度研究模式 | yuanbao.tencent.com/chat |
| 11 | ima | Chat | ima.qq.com/chat |
| 12 | Gemini | Gemini App | gemini.google.com |
| 13 | Google AI Studio | AI Studio | aistudio.google.com |
| 14 | Google Search AI Mode | AI Mode | www.google.com/search?sourceid=chrome&aep=42&atvm=2&udm=50 |
| 15 | 秘塔 AI 搜索 | 搜索 | metaso.cn/chat |
| 16 | Perplexity | 搜索 / Research | www.perplexity.ai |
| 17 | 腾讯元宝 | 联网搜索 | yuanbao.tencent.com/chat |
| 18 | Microsoft Copilot | 迭代研究 | m365.cloud.microsoft/chat |
| 19 | 腾讯元宝 | 默认模式 | yuanbao.tencent.com/chat |
| 20 | DeepSeek | Chat | chat.deepseek.com |
| 21 | ChatGPT | ChatGPT | chatgpt.com |
| 22 | 腾讯元宝 | 超级元宝 | yuanbao.tencent.com/chat |
| 23 | Grok | Grok | grok.com |
| 24 | 智谱清言 | 补测完整显示 | chatglm.cn |
实验条件补充:10 / 腾讯元宝
10号实际使用的是腾讯元宝“深度研究模式”,测试当时未在匿名答案中标注,因此此前一度被记录为普通元宝入口。现已按用户补充修正。
这使元宝形成完整四模式对照:深度研究 78 > 默认 72 > 超级元宝 66 > 联网搜索 61。对这类复杂市场调查,深度研究模式明显最适合;但“超级元宝”并没有优于默认模式。
最重要的同产品对照组
| 产品家族 | 编号 | 天然实验价值 |
|---|---|---|
| 智谱 | 01 / 02 / 03 / 24 | 清言、Z.ai、BigModel Console、刷新后补测:可比较同厂不同入口/完成状态。 |
| Kimi | 04 / 05 | kimi.ai 与 kimi.com 两个入口,可观察同品牌不同站点/产品层差异。 |
| 千问 / Qwen | 06 / 07 | 中文入口与国际 Qwen Chat 的差异。 |
| 腾讯元宝 | 10 / 17 / 19 / 22 | 深度研究、联网搜索、默认模式、超级元宝——本次最有价值的同产品多模式对照。 |
| 12 / 13 / 14 | Gemini App、AI Studio、Google Search AI Mode:同生态不同产品层的直接比较。 |
实验条件修正:18 / Microsoft Copilot
Copilot 首轮主动提示“这份调查只完成了约 25%–30% 的范围”。用户随后只发送了“继续补充”,没有提供新的事实、方向、标准或纠错信息。
因此:18 号应计为同一原始提示下的多轮自主研究,而不是“用户通过新增提示词帮助它完成答案”。最终比较时可以单独标注为“允许模型按自身提示继续完成”的迭代式研究样本。
揭晓后立即能确认的事情
- 平台/模式影响非常大。同一厂商在不同入口的得分和画像可以差很多,单凭“文风”反推底模并不可靠。
- 元宝是最好的天然实验。10 深度研究、17 联网搜索、19 默认模式、22 超级元宝构成完整四模式对照:深度研究最高,默认次之,超级元宝与联网搜索反而更低。
- Google 生态也值得单独看。12 Gemini、13 AI Studio、14 Google Search AI Mode 可以帮助判断“同一模型/生态,不同产品层”究竟怎样改变检索行为。
- 18 Copilot需要特殊标记。首轮由Copilot主动提示“这份调查只完成了约25%–30%的范围”,用户随后仅回复“继续补充”,没有增加任何新提示词、事实或判断标准。因此它更应视为同一任务下由模型自我识别覆盖不足后继续研究,而不是人为增强提示。
- 21 = ChatGPT 是一个重要结果。匿名阶段它被画像为“证据驱动研究员型”,说明这次表现出来的更像研究/检索产品能力,而不仅是聊天模型能力。
揭晓前高置信猜测 vs 真相
| 揭晓前猜测 | 真实结果 | 结论 |
|---|---|---|
| 12 ≈ ChatGPT / OpenAI | Gemini | 错误;个性化/长期上下文感并不是 ChatGPT 独有指纹。 |
| 21 ≈ Perplexity Research | ChatGPT | 错误;证据驱动研究风格可能来自平台Research工具链,而非搜索品牌本身。 |
| 11 ≈ Claude 家族 | ima | 错误;极端保守/低幻觉更可能是产品层检索与回答策略。 |
| 18 / 19 / 20 / 22 至少两个同源 | 19 / 22 均为腾讯元宝 | 部分命中;聚类抓到了真实产品同源,但18=Copilot、20=DeepSeek。 |
| 10 / 16 / 21 至少两个共享高证据纪律家族 | 10=元宝,16=Perplexity,21=ChatGPT | 品牌层未命中;说明“证据纪律”是跨产品可形成的研究模式,而不是独占模型指纹。 |
下一步
实名后不应只做“24个品牌排名”。更有价值的是同时做三层比较:产品排名、同厂不同模式对照、同类产品的角色定位。这样才能回答最终选型问题:到底该换模型、换平台,还是只需要切换搜索/研究模式。
实名最终横向对比与选型建议
匿名评分、画像和聚类猜想均保留,不因身份揭晓而改分。本页把24份回答映射到真实产品,并额外考虑同产品多入口/多模式的稳定性。最终选型不是机械取最高分,而是结合你的真实需求:大陆公开网页召回、权威一手来源、时效性、引用可审计、低幻觉,以及API/产品研究能力。
24份实名总排名(保留匿名阶段原始分)
| 排名 | 编号 | 产品 | 入口/模式 | 分数 | 画像 |
|---|---|---|---|---|---|
| 1 | 21 | ChatGPT | ChatGPT | 84 | 证据驱动研究员型 |
| 2 | 10 | 腾讯元宝 | 深度研究模式 | 78 | 证据优先审计型 |
| 3 | 20 | DeepSeek | Chat | 75 | 新鲜全面型 |
| 4 | 05 | Kimi | kimi.com | 73 | 均衡强检索型 |
| 5 | 19 | 腾讯元宝 | 默认模式 | 72 | 国内生态广覆盖型 |
| 6 | 13 | Google AI Studio | AI Studio | 70 | 广度深挖型 |
| 7 | 07 | Qwen Chat | 国际 Chat | 68 | 强搜索弱收口型 |
| 8 | 18 | Microsoft Copilot | 迭代研究 | 67 | 迭代研究型 |
| 9 | 09 | Dola | Chat | 66 | 高召回价格易漂移型 |
| 10 | 22 | 腾讯元宝 | 超级元宝 | 66 | 资料重但锚点陈旧型 |
| 11 | 16 | Perplexity | 搜索 / Research | 65 | 保守审计型 |
| 12 | 04 | Kimi | kimi.ai | 64 | 真实检索入门型 |
| 13 | 17 | 腾讯元宝 | 联网搜索 | 61 | 局部前沿但不同步型 |
| 14 | 15 | 秘塔 AI 搜索 | 搜索 | 58 | 广搜二手收口型 |
| 15 | 08 | 豆包 | 默认 Chat | 56 | 谨慎研究型 |
| 16 | 23 | Grok | Grok | 54 | 市场速览型 |
| 17 | 12 | Gemini | Gemini App | 52 | 上下文顾问型 |
| 18 | 01 | 智谱清言 | 普通入口 | 49 | 受限搜索型 |
| 19 | 24 | 智谱清言 | 补测完整显示 | 46 | 诚实低召回型 |
| 20 | 14 | Google Search AI Mode | AI Mode | 45 | 二手来源驱动型 |
| 21 | 11 | ima | Chat | 42 | 零幻觉拒答型 |
| 22 | 06 | 千问 | 中文 Chat | 27 | 摘要大于检索型 |
| 23 | 03 | BigModel Console | 开放平台控制台 | 12 | 旧知识包装型 |
| 24 | 02 | Z.ai Chat | 国际 Chat | 11 | 补全型幻觉 |
同产品 / 同生态多入口对照
| 产品家族 | 编号 | 分数 | 均分 | 揭示的问题 |
|---|---|---|---|---|
| 腾讯元宝 | 10 / 17 / 19 / 22 | 78 / 61 / 72 / 66 | 69.3 | 多模式样本最多;中国生态召回强,但模式间波动明显。默认/普通模式优于“超级元宝”并非偶然假设,需要按任务选模式。 |
| Kimi | 04 / 05 | 64 / 73 | 68.5 | 两个入口都进入中上区,kimi.com明显更强;中文研究与Agent潜力好。 |
| 12 / 13 / 14 | 52 / 70 / 45 | 55.7 | 同生态差异巨大:AI Studio明显优于Gemini App与Search AI Mode,证明入口影响很大。 | |
| 千问 / Qwen | 06 / 07 | 27 / 68 | 47.5 | 国际Qwen Chat远好于中文入口这次表现,产品层差异非常大。 |
| 智谱 | 01 / 02 / 03 / 24 | 49 / 11 / 12 / 46 | 29.5 | 同厂不同入口差异极端;Z.ai/Console这次不适合当前事实检索,清言相对更稳但召回不足。 |
第一梯队:真正可作为主检索入口
最终选型:全球平台
推荐:ChatGPT
原因:21号84分是本轮最高,而且它的优势正好命中你的使用需求:权威来源优先、当前产品/价格核验、Help与API文档追踪、Provider与套餐边界、低幻觉和明确不确定性。更重要的是,你已经拥有ChatGPT Plus,因此继续把它作为全球主研究入口没有新增订阅成本。
为什么不是 Perplexity:16号65分的证据纪律不错,但这次过度保守、公开事实漏召回较多;作为二次核查或快速搜索仍有价值,但没有在这次复杂调查里超过ChatGPT。
为什么不是 Gemini:Google三入口最高是AI Studio 13号70分,但Gemini App 52、Search AI Mode 45,入口差异太大;既然你已经有Gemini付费,它更适合继续作为第二全球研究源,而不是替代ChatGPT成为唯一主入口。
最终选型:中国平台
推荐:腾讯元宝
原因:它是本轮中国平台中样本最多、最能体现中国本地检索价值的一组:10号78分、19号默认72分,国内模型与中文生态召回尤其强。它和ChatGPT形成的互补关系也比再选一个偏全球知识的产品更明确。
使用方式:日常快速查询优先默认模式;遇到这类需要跨厂商、跨价格页、跨证据链的复杂调查时,优先深度研究模式(10号78分,为元宝四种模式最高)。联网搜索适合作为轻量补充;“超级元宝”22号只有66分,说明“更重/更超级”并不自动意味着事实锚点和最终QC更准。
最接近的第二名:DeepSeek。20号75分,单次表现其实比元宝默认更高,而且全球最新AI信息召回非常漂亮。如果你的核心需求进一步从“大陆公开网页/中文生态”转向低价API + Coding + 中外技术情报,我会把中国推荐从元宝切换为DeepSeek。
你的最终两平台组合
| 角色 | 推荐 | 主要职责 | 备用/复核 |
|---|---|---|---|
| 全球主研究入口 | ChatGPT | 全球产品、API、论文/文档、复杂研究、证据链、跨来源冲突处理 | Gemini / Perplexity |
| 中国大陆主检索入口 | 腾讯元宝 | 大陆公开网页、国内厂商/政策/中文生态、快速本地事实召回 | DeepSeek / Kimi |
这套组合的核心不是“两家最强模型”,而是两种检索生态互补:ChatGPT负责全球和严谨研究,元宝负责大陆中文公开网络;DeepSeek则保留为API/Coding和技术情报方向的强力候补。
几个重要的实验结论
- 入口/模式影响可能大于底模:Google、元宝、智谱、Kimi、Qwen的同厂样本差异都非常明显。
- “超级/Research”不保证更准:元宝内部呈现清晰梯度:深度研究10号78 > 默认19号72 > 超级元宝22号66 > 联网搜索17号61。更长或更重的模式并不必然更准,关键仍是检索策略与最终QC。
- Copilot的多轮不是人为加提示:18号首轮自己声明只完成约25%–30%,用户仅回复“继续补充”。因此它体现的是模型自我识别覆盖不足后的迭代研究能力。
- 匿名画像比品牌猜测更可靠:我们对“证据审计型、市场速览型、保守低召回型”等行为分类相当稳定,但靠这些风格反推具体品牌的成功率很低。