RESEARCH BENCHMARK

选出真正“会查资料”的境内 AI 信息入口

本评测不比较谁更会写漂亮答案,而比较谁能在高时效、跨产品、跨价格体系的问题上主动检索、优先采用一手来源、正确处理冲突,并在证据不足时克制地说“不确定”。

24 个实名样本逐份事实核查同一评分尺最终揭晓身份
24回答样本
100单份总分
6.7841USD/CNY 基准汇率(2026-08-24 中间价)

工作方式

在Web平台提问,得到答案并保存。选定评分平台。每次上传 1 份 Markdown 答案 。评分平台审阅后综合评价,内容包括:摘要、事实错误、遗漏、来源质量、价格计算、模型/套餐分类、幻觉风险、总分与评语。

保留原始回答中的链接、脚注、引用编号和“搜索来源”文字。它们本身就是评分对象。

为什么采用逐份匿名评测?

每份回答都很长,而且很多事实需要重新访问官方页面核对。逐份处理能让每一次核查都有明确边界,也方便把新发现的官方事实反向补进“事实核查基准”,避免后面的答案因为基准过旧而被误判。

完整测试题

事实核查基准 v0.1

这是“动态基准”,只记录已经由当前官方资料或高可信一手资料钉死的事实。未确认项目宁可留空。随着 24 份回答逐一审阅,基准将继续扩充并记录冲突。

重要:“最新模型”并不总是单一字段。例如 Anthropic 同时存在更新一代的 Sonnet 5 与更高定位的 Opus 4.8;Google 的 Pro 型号仍有 Preview 标记。评测时必须看回答是否识别这种产品语义,而不是强行选一个名字。

已核验锚点

对象截至 2026-08-24 的核验事实状态
汇率中国外汇交易中心 2026-08-24 人民币汇率中间价:1 USD = 6.7841 CNY。本评测的美元价格统一用此汇率折算。已核验
OpenAIGPT‑5.6 系列当前包括 Sol / Terra / Luna。官方 7 月 30 日公告:Terra 标准 API 为 $2 输入 / $12 输出每 1M tokens,Luna 为 $0.20 / $1.20;Sol 价格保持不变,API 定价页列短上下文标准价 $5 / $30。已核验
AnthropicClaude Sonnet 5 已发布并可用,至 2026-08-31 的介绍价为 $2 输入 / $10 输出每 1M;之后 $3 / $15。Anthropic 2026-05-27 价表同时列出 Claude Opus 4.8,标准 API $5 / $25。回答若把“最新一代”和“最高端旗舰”混成一个概念需说明。已核验
GoogleGoogle 官方截至 2026-08-24 已将 Gemini 3.7 Flash 设为 GA,Model ID gemini-3.7-flash,1M context;截至 2026-12-31 标准 API 促销价为 $0.75 输入 / $3.75 输出每 1M。Gemini 3.6 Flash 同期也执行相同促销价。Gemini 3.1 Pro 仍标记为 Preview,≤200K 标准价 $2 / $12。已核验
DeepSeek官方 API 当前列 DeepSeek‑V4‑Flash 与 DeepSeek‑V4‑Pro,均 1M context。缓存未命中输入分别 ¥1 / ¥3 每 1M,输出 ¥2 / ¥6已核验
KimiKimi Chat 当前可选 K2.6 / K3 / K3 Cluster;K2.6 聊天入口免费且不消耗会员额度。最低会员 Andante ¥49/月,含约 30 次 Agent、Deep Research、Office、Kimi Code、1000 次专业数据库调用等;会员功能共享额度池。已核验
GLM智谱官方开放文档当前仍将 GLM‑5.2 标为“最新旗舰模型”。但 OpenCode Go 的官方页面列出了 GLM‑5.3。两者存在值得核查的口径差异,不能仅凭第三方/Provider 名称断言“GLM‑5.3 是智谱官方当前旗舰”。官方口径冲突/待解释
OpenRouter统一 API 聚合平台;Pay‑as‑you‑go 对底层 Provider 推理价不加价,但购买 credits 收 5.5%(最低 $0.80)费用。支持多 Provider、自动路由与 fallback;免费模型有较低限流。已核验
OpenCode GoOpenCode 官方:首月 $5,之后 $10/月;是低成本 Coding 模型订阅,不是基础模型。会提供 Go API key,并有 OpenAI/Anthropic-compatible endpoints;官方写明可用于 any agent。当前列表含 Grok 4.5、GLM-5.3/5.2、GPT 5.6 Luna、Kimi K3、Qwen3.8 Max、DeepSeek V4 等。已核验
Agnes目前检索到 AgnesAI-Labs / Agnes-AI 项目公开套餐与 OpenAI-compatible API 信息,但“官方商业产品身份、当前正式价格与模型版本”还需要在审阅相关回答时继续做一手来源确认。待进一步核验
Qwen / 豆包 / 混元 / 文心 / MiniMax / SiliconFlow / xAI暂不在 v0.1 为了填满表格而硬写。将在逐份审阅中按回答涉及的具体模型、套餐和 Provider 精确核查。待核验

单份回答评分规则 · 100 分

核心事实准确性 30
模型版本、会员价、API价、套餐性质、Provider 关系。
时效性与主动检索 15
是否真正查到 2026-08-24,而不是旧知识。
一手来源质量 15
官方价格页/文档/公告优先;二手源只作补充。
引用支持度 15
链接存在不等于引用成立;必须真正支持对应结论。
覆盖与结构化 10
是否完成题目要求,并正确区分 Chat/API/Coding/聚合平台。
幻觉与不确定性控制 10
查不到能否明确说“未确认”,而不是补全。
计算与可比性 5
汇率、1M token、缓存未命中、同模型同版本比较是否正确。

严重扣分项

  • 伪造模型、套餐、官方页面或价格。
  • 把 Chat 会员额度当普通 API 余额。
  • 把缓存命中价 / Batch 折扣当常规输入价。
  • 把不同版本、量化版、Flash/Pro 等放在同一“同模型”价格组直接比较。
  • 明确给出过时数据,却声称“截至 2026-08-24 最新”。
  • 引用页面与结论不匹配,尤其是拿第三方营销稿覆盖官方文档。
REFERENCE ANSWER · 2026-08-24

参考答案

这不是“唯一正确措辞”,而是一份用于对照评分的标准作答:优先采用官方一手资料,严格区分 Chat 产品、API、Coding Plan、聚合平台和第三方 Provider;无法由官方资料确认的项目明确保留不确定性,不为了填满表格而猜测。

基准日:2026-08-24 Model-first 官方来源优先 Chat ≠ API 余额

一、先给结论

  • 全球通用研究入口:ChatGPT / Gemini / Claude 等产品必须与其开发者 API 分开看;个人订阅通常不等于普通 API 余额。
  • 中国平台:DeepSeek、Kimi、Qwen、GLM、豆包、混元、文心、MiniMax 等要分别核对 Chat、开放平台 API、Coding Plan / Token Plan,不能把“会员”与“API 充值”混为一谈。
  • 模型比较必须先锁定模型身份:只有 model ID / 名称 / 版本一致,才能做官方、OpenRouter、SiliconFlow、云厂商之间的同模型价格比较。Flash / Pro、Turbo / Lite、蒸馏、量化、旧版本都不能混为“同模型”。
  • 汇率统一:本评测按 2026-08-24 中国外汇交易中心人民币汇率中间价,1 USD = 6.7841 CNY

二、截至 2026-08-24 的主要模型状态

厂商当前应识别的模型/层级状态与注意事项
OpenAIGPT-5.6 Sol / Terra / LunaSol 为旗舰层级;Terra、Luna 为更低成本层级。回答必须区分 ChatGPT 内可用模型与 API model。
AnthropicClaude Fable 5;Mythos 5Fable 5 为公开可用高端层级;Mythos 5 为受限层级。不能把“公开可用最高层级”和“受限最高层级”混写。
GoogleGemini 3.7 Flash;Gemini 3.1 Pro3.7 Flash 已 GA;3.1 Pro 仍为 Preview。正式版与 Preview 必须分开。
xAIGrok 4.6长上下文存在分段价格,不能只写单一输入/输出价而不说明上下文档位。
DeepSeekDeepSeek-V4-Flash / V4-Pro当前 API 主力;旧的 deepseek-chat / deepseek-reasoner 已不应继续作为“当前主模型”锚点。
KimiK2.6 / K3 / K3 ClusterK2.6 Chat 免费且不消耗会员额度;会员、Kimi Code 与 API 需分别讨论。
QwenQwen3.8 Max 等当前代模型需要按官方具体 model ID 核对;不能将旧 Qwen3.x 版本直接当作当前旗舰。
智谱GLM-5.3当前代旗舰 / Coding 主力;中国开放平台价格与国际 Z.ai 价格可能不同,必须注明使用哪套官方价格体系。
腾讯混元Hy3应按腾讯官方 API / 控制台的具体 model ID 与价表核验。
百度文心ERNIE 5.1存在上下文档位差异,需按官方价表写明。
MiniMaxMiniMax M3长上下文存在分段价格与缓存价,标准比较应使用缓存未命中输入价。
豆包Doubao 2.1 / Seed 系列需按火山方舟当前 model ID 与价格页核验;不要用旧 Seed 2.0 代替当前代。
AgnesAgnes 2.5 Pro Alpha / 2.5 Flash既有自有模型,也有 Agent / Chat 产品和 OpenAI-compatible API;不能简单归类成纯聚合壳。

三、个人订阅与 API:必须分开

产品最低主要个人付费关键权益是否等于普通外部 API 余额
ChatGPTPlus:$20/月更高模型/消息限额、研究与产品功能等否。ChatGPT Plus 不包含可在 OpenAI Platform 随意调用的普通 API 余额。
ClaudePro:$20/月;$200/年更高使用限额与高端模型访问否。Claude Pro 与 Anthropic Console API 计费分离。
KimiAndante:¥49/月约 30 次 Agent、Deep Research、Office、Kimi Code、专业数据库调用、项目与存储等否。会员额度不应写成 Moonshot 普通 API 余额。
GLM Coding PlanLite:标价 ¥118/月;当前活动价 ¥94.4/月10,000 Credits / 周;滚动接入最新旗舰模型,支持 20+ Coding Agent / IDE不能直接等同。使用 Coding 专用 endpoint,与通用 BigModel API 余额和 endpoint 分离。
OpenCode Go首月约 ¥33.92,之后约 ¥67.84/月面向 Coding Agent 的多模型订阅,可获得 Go API key / compatible endpoints不是原厂通用 API 余额。但官方允许用于 OpenCode 或其他兼容 Agent。
评分锚点:凡是把 ChatGPT Plus、Claude Pro、Kimi 会员、Coding Plan 等直接描述成“包含等额普通 API 余额”,都属于严重概念错误。

四、代表性官方 API 价格

以下统一优先写“标准、缓存未命中、非 Batch”的 1M token 价格。美元计价项目按本页基准汇率 1 USD = 6.7841 CNY 换算为人民币,结果四舍五入至分。若存在促销且在 2026-08-24 正在生效,应按当前实际可用价列出,并标注促销期限。

模型输入 / 1M(人民币)输出 / 1M(人民币)重要备注
GPT-5.6 Sol¥27.14¥135.682026-08-21 起的阶段性降价;缓存输入另计。标准答案应识别当前生效价,而不是继续使用旧价约 ¥33.92 / ¥203.52。
GPT-5.6 Terra¥13.57¥81.41更低成本层级。
GPT-5.6 Luna¥1.36¥8.14低成本层级。
Claude Fable 5¥67.84¥339.21公开可用高端层级。
Gemini 3.7 Flash¥5.09¥25.44当前促销价截至 2026-12-31;缓存输入约 ¥0.51 / 1M。
DeepSeek-V4-Flash¥1.5 低谷 / ¥3 高峰¥4.5 低谷 / ¥9 高峰需明确峰谷时段;不能只挑最低价做“标准价格排名”。
DeepSeek-V4-Pro¥4.5 低谷 / ¥9 高峰¥13.5 低谷 / ¥27 高峰同上。
GLM-5.3中国官方价格体系应按 BigModel 当前价表核验同左不要拿 Z.ai 国际美元价冒充中国官方人民币价。
ERNIE 5.1≤32K:¥4;32K–128K:¥6≤32K:¥18;32K–128K:¥22存在上下文分档。
MiniMax M3≤512K:¥2.1;>512K–1M:¥4.2≤512K:¥8.4;>512K–1M:¥16.8当前折扣价;缓存价不能拿来当普通输入价。
Agnes 2.5 Pro Alpha¥3.05¥6.11OpenAI-compatible API,1M context。
Agnes 2.5 Flash当前 ¥0当前 ¥0512K context;标准标价约 ¥0.20 / ¥1.02,但官方当前价为 $0 / $0。免费不等于无限量,仍以账户与 API Key 的速率限制、权限为准。

五、主要 LLM 在不同平台 / Plan 中的价格横向对比

先看完全相同模型 / 明确版本的 API 单价,再看该模型是否包含在月度 Plan 中。API 单价统一为 人民币 / 1M tokens(输入 / 输出);美元均按 1 USD = 6.7841 CNY 换算。月度 Plan 是受时间窗口、Credits、请求估算或公平使用约束的订阅,不能直接除成稳定 token 单价

A. 同模型 / 同版本的 API 与 Plan 覆盖

模型 / 版本原厂官方 APIOpenRouterSiliconFlow可用月度 Plan(当前)
GPT-5.6 Sol¥27.14 / ¥135.68活动价 ¥13.57 / ¥67.84
50% off;需核对活动结束时间
未列出完全同名 / 同 ID未在下列主流多模型 Coding Plan 中列出
GPT-5.6 Terra¥13.57 / ¥81.41¥13.57 / ¥81.41未列出完全同名 / 同 ID未在下列主流多模型 Coding Plan 中列出
GPT-5.6 Luna¥1.36 / ¥8.14¥1.36 / ¥8.14未列出完全同名 / 同 IDOpenCode Go:月度约 10,250 次请求估算
Claude Fable 5¥67.84 / ¥339.21¥67.84 / ¥339.21未列出完全同名 / 同 ID未在下列主流多模型 Coding Plan 中列出
Gemini 3.7 Flash活动价 ¥5.09 / ¥25.44特定路由活动价最低 ¥2.54 / ¥12.72
Google Vertex 路由 75% off;其他路由可能为 ¥5.09 / ¥25.44
未列出完全同名 / 同 ID未在下列主流多模型 Coding Plan 中列出
DeepSeek-V4-Flash低谷 ¥1.5 / ¥4.5
高峰 ¥3 / ¥9
0731:活动价约 ¥0.27 / ¥0.54;DeepSeek 直供约 ¥1.49 / ¥4.48deepseek-ai/DeepSeek-V4-Flash
¥1 / ¥2
OpenCode Go:月度约 37,800 次请求估算
DeepSeek-V4-Pro低谷 ¥4.5 / ¥13.5
高峰 ¥9 / ¥27
0813 当前聚合约 ¥4.25 / ¥12.76;DeepSeek 直供约 ¥4.48 / ¥13.43deepseek-ai/DeepSeek-V4-Pro
¥12 / ¥24
OpenCode Go:月度约 5,200 次请求估算
Kimi K2.6应按 Moonshot 当前 model ID / 价表核验未在本表冻结可严格核对的同 ID 报价Pro/moonshotai/Kimi-K2.6
¥6.5 / ¥27;带 Pro 前缀,不能直接视为原厂同 ID
OpenCode Go:约 5,750 次/月;Kimi 会员含 Kimi Code,但使用 kimi-for-coding 动态映射模型
GLM-5.3中国通用 API 价应按 BigModel 当前价表核验未在本表冻结可严格核对的同 ID 报价当前公开价表仅列 GLM-5.2,不能替代 5.3OpenCode Go:约 1,080 次/月;GLM Coding Plan滚动接入旗舰模型
Qwen3.8 Max应按 QwenCloud / 阿里云当前 model ID 核验未在本表冻结可严格核对的同 ID 报价未列出完全同名 / 同 IDOpenCode Go:约 810 次/月;Qwen Token Plan明确包含 Qwen3.8-Max
MiniMax M3≤512K:¥2.1 / ¥8.4;长上下文另档未在本表冻结可严格核对的同 ID 报价仅列 MiniMax-M2.5,不能替代 M3OpenCode Go:约 16,000 次/月;MiniMax Token Plan约 1.7B–12.5B M3 tokens/月
Agnes 2.5 Flash
agnes-2.5-flash
当前 ¥0 / ¥0
标准标价约 ¥0.20 / ¥1.02
未列出完全同名 / 同 ID未列出完全同名 / 同 ID无需月费;免费 API 仍受账户 / API Key 限流与权限约束

B. 主流 Coding / Token Plan 月费与覆盖

平台 / Plan月费(人民币)主要模型覆盖额度口径能否接入其他工具
OpenCode Go首月约 ¥33.92
之后约 ¥67.84
GPT-5.6 Luna、GLM-5.3、Kimi K3 / K2.7 Code / K2.6、MiniMax M3、Qwen3.8 Max、DeepSeek V4 Pro / Flash、Hy3 等约 ¥81.41 / 5h、¥203.52 / 周、¥407.05 / 月的内部美元价值上限;请求数按模型估算,不是固定 token 包可以。Go API key + OpenAI / Anthropic-compatible endpoints;不是原厂 credit
Kimi 会员 / Kimi CodeAndante ¥49
Moderato ¥99
Allegretto ¥199
Allegro ¥699
Kimi Code 使用固定 ID kimi-for-coding,后端自动更新;K2.6 Chat 免费且不消耗会员额度Agent、Deep Research、网站、Office、Kimi Code 等共享会员额度池;具体消耗按 token / 功能计算可接第三方 Coding Agent。但会员额度不是 Moonshot 通用 API 余额;高速模式需更高档会员
GLM Coding PlanLite:活动价 ¥94.4(标价 ¥118)
Pro:¥430.4(标价 ¥538)
Max:¥862.4(标价 ¥1,078)
滚动接入最新 GLM 旗舰;官方当前说明含 GLM-5.3 / 5.2 等Lite 10,000 Credits / 周;Pro 为 6× Lite;Max 为 14× Lite可以。支持 20+ Agent / IDE,但须走 Coding 专用 endpoint,与通用 API 分离
Qwen Token PlanIndividual 低至约 ¥40.70($6/月)明确包含 Qwen3.8-Max,并统一覆盖文本、视觉、语音、图像等模型Lite / Standard / Pro;Standard 为 Lite 4× Credits,Pro 为 Lite 16×;具体促销价和 Credits 以订阅页登录后为准可以。提供 API key / Base URL,兼容 OpenAI、Anthropic 协议及主流 Coding 工具
MiniMax Token PlanPlus 约 ¥135.68($20)
Max 约 ¥339.21($50)
Ultra 约 ¥814.09($120)
MiniMax M3 / M2.7 / 图像 / 语音 / 音乐,共享额度约 1.7B / 5.1B / 12.5B M3 tokens/月;另有并发、公平使用与时间窗口约束可以。面向日常交互式 Agent / Coding 工具;不应当作无约束生产 API 余额
读表规则:同一行出现“未列出完全同名 / 同 ID”不是资料缺失,而是有意拒绝把近似模型硬凑成同模型。OpenRouter 的活动路由价、DeepSeek 峰谷价和各 Plan 的估算请求数都可能变化;做采购决策时必须再次打开对应官方实时价页。

六、Model-first 的同模型 Provider 比较

正确做法不是先比较“平台谁便宜”,而是先锁定一个完全相同的模型 ID / 版本,再看不同 Provider 的实际价格、缓存、上下文、附加费、限流与大陆可用性。

检查项标准
模型身份名称、版本、model ID 一致;不接受“同一家族”替代“同模型”。
输入价使用标准缓存未命中输入价;不使用 cached input / Batch 作为主排名。
输出价按相同单位 1M tokens 比较。
上下文确认 Provider 是否裁剪上下文、输出长度或工具能力。
版本差异量化、蒸馏、Flash / Turbo / Lite、旧日期版本必须单列。
最终成本再叠加充值手续费、汇率、税费、最低充值、余额有效期。
因此:若 OpenRouter / SiliconFlow 上没有与官方完全相同的模型版本,就应该写“无法做严格同模型比较”,而不是硬拿近似版本凑表。

七、OpenRouter

  • 本质:统一 LLM API gateway / marketplace,不是单一模型厂商。
  • 模型推理价格通常按底层 Provider 标价透传,不是额外加 5.5% 推理 markup
  • 购买 credits 收 5.5% 手续费,最低 $0.80;加密货币充值约 5%。
  • 支持 provider routing、locking、fallback、BYOK。
  • BYOK:每月前 1M requests 免费,之后按等价模型 / Provider 成本收约 5%。
  • 免费模型有日请求限制;累计购买一定 credits 后免费模型日限额会提高。
  • credits 可能在长期未使用后到期,因此“标价”与“最终实际成本”应分开写。

八、SiliconFlow

  • 本质:聚合推理平台 / 模型服务平台,提供 OpenAI-compatible API。
  • 对中国大陆用户通常在网络、支付与国产模型覆盖方面更友好。
  • 必须逐个核对模型是否为原始模型,还是量化 / 蒸馏 / Turbo / Lite / 平台改版。
  • 与官方 API 做比较时,只有模型身份完全一致才可直接比较价格。
  • 促销价、赠送额度、免费层与限流应单独列出,不应拿来替代标准长期价格。

九、OpenRouter vs SiliconFlow

维度OpenRouterSiliconFlow
定位全球多 Provider 路由 / marketplace中国友好的聚合推理与模型服务平台
模型广度全球闭源 + 开源覆盖非常广国产 / 开源模型覆盖强
费用模型价透传;credits 购买费 5.5%按平台价表,需逐模型核对
大陆网络 / 支付通常不如境内平台便利通常更友好
路由能力Provider routing / locking / fallback 强更偏统一国内推理平台体验
适合跨 Provider、全球模型、统一路由中国用户、国产 / 开源模型、低门槛兼容 API

十、OpenCode Go

  • 不是模型,而是面向 Coding Agent 的低价模型订阅。
  • 官方价格:首月 $5,之后 $10/月
  • OpenCode 本体免费;Go 是可选模型额度方案。
  • 官方明确写明 “Use with any agent”,因此不应回答成“只能在 OpenCode 内使用”。
  • 它会提供 Go API key / OpenAI-compatible 或 Anthropic-compatible endpoint,可用于兼容 Agent。
  • 但它仍然不是 OpenAI、Anthropic、Kimi、DeepSeek 等原厂账户里的普通 API 余额,也不能把 Go 额度“转移”到原厂账户。
  • 套餐的请求数 / 5h 是按不同模型估算,不等于固定 token 包;还会受公平使用、动态限流和模型成本影响。

十一、Agnes

  • 应先识别为有自有基础模型 + Agent 产品 + API的 AI 公司 / 平台,而不是简单的第三方 Chat wrapper。
  • Agnes 2.5 Pro Alpha:model ID agnes-2.5-pro,OpenAI-compatible /v1/chat/completions / Responses API,1M context。
  • Agnes 2.5 Flash:512K context;官方当前 API 输入 / 输出均为 ¥0。标准标价约 ¥0.20 / ¥1.02,但免费调用仍受账户 / API Key 的速率限制和权限约束。
  • 若某项会员价格 / 免费额度无法从 Agnes 官方页面确认,应明确写“未从官方公开资料确认”,不要从二手页面补全。

十二、实际成本怎么比较

  1. 先写官方 / Provider 的 sticker price。
  2. 统一按 1M 标准、缓存未命中输入 + 输出。
  3. 若美元计价,本评测统一按 6.7841 换算人民币。
  4. 再叠加充值费、平台费、信用卡 / 支付渠道、税费。
  5. 列明最低充值、余额有效期、是否需要预充值。
  6. 促销价必须注明有效期;不能拿已经结束的促销做当前排名。

十三、最终推荐逻辑

需求优先选择理由
全球最新 AI / API / 产品研究ChatGPT 等具备强检索与官方文档追踪能力的研究入口重点看证据链、一手来源、Help / Pricing / API 文档命中率,而不是只看基座模型名。
中国大陆公开网页 / 中文厂商 / 本地生态元宝 / DeepSeek / Kimi 等中国平台中实测检索较强者更容易覆盖境内网页、政策、厂商公告与中文社区。
统一全球模型 APIOpenRouter全球 Provider 路由、fallback、BYOK 与模型广度。
中国友好聚合 APISiliconFlow网络 / 支付 / 国产和开源模型覆盖更友好。
低成本 Coding AgentOpenCode Go / GLM Coding Plan 等按 Agent 场景购买额度,不能与普通 API 充值混为一谈。

十四、标准答案最重要的“不要做”

  • 不要因为产品名熟悉,就凭旧知识写“截至 2026-08-24 最新”。
  • 不要把 Chat 会员写成普通 API credit。
  • 不要拿 cached input / Batch / 峰谷最低价冒充标准输入价。
  • 不要把不同版本、不同模型后缀、量化版、蒸馏版直接当作同模型。
  • 不要用第三方营销稿覆盖官方 Pricing / Model / Help 页面。
  • 不要为了表格完整而补全无法确认的 Agnes、国产模型、套餐或 API 信息。
  • 遇到官方口径冲突时,应该把冲突本身写出来,并说明哪个结论目前不能确定。
ANONYMOUS CLUSTER HYPOTHESIS

聚类猜想:哪些回答可能属于同一类,甚至可能同源?

以下不是身份猜测,而是基于匿名回答的行为特征做聚类:搜索深度、来源纪律、最新事实召回、Provider比价方式、不确定性控制、是否做最终QC等。相同底模在不同平台/模式下可能跨簇;同一编号也可能同时具有两个簇的特征。

匿名阶段推断 允许跨簇 不根据文风猜品牌

簇 A · 证据审计型

10 / 16 / 21

共同特征:官方优先、先判断证据等级再决定是否下结论、严格区分正式版与 Preview、Chat会员与API余额、同模型不同Provider。宁愿留空,也不愿伪造精确值。

内部差异:10最像“证据审计员”;16把保守阈值拉得更高,召回下降;21则像在10的基础上补齐了Help/Pricing/Token Plan/Provider页面检索。

强同源猜测:10 / 16 / 21 至少有两个可能来自同一底层模型家族;21尤其像10的更强检索/研究模式。

簇 B · 大规模搜集—长报告型

18 / 19 / 20 / 22

共同模式:先搭很大的研究框架,连续搜索大量厂商和价格页,输出长表格;国内模型覆盖积极;随着链路变长,容易逐渐混入第三方价格站、旧锚点或表格QC问题。

内部演化感:18最有“继续第二轮、第三轮补查”的过程感;19国内覆盖明显增强;20最新海外锚点更齐;22又出现“资料很多但关键锚点停旧”的情况。

强同源猜测:18 / 19 / 20 / 22 里很可能有多个来自同一产品或同一家模型家族,只是模型档位/搜索模式不同。

簇 C · 广搜 Provider / 工程化研究型

05 / 07 / 09 / 13 / 17

共同特征:不仅找模型,还会继续往具体Provider、价格节点、第三方推理商、服务档位下钻;最新模型召回积极,数值很多,但也最容易把促销价、峰谷价、旧快照和不同Provider版本混到一起。

内部差异:05最均衡;07强搜但收口弱;09最新模型捕捉强、价格漂移明显;13 Provider深挖最突出;17像一次状态不稳定运行——局部极新、整体不同步。

较强同源猜测:07 / 13 / 17 很可能更近;05 / 09 可能是邻近家族,也可能与前者属于更大的同源簇。

簇 D · 保守低召回型

08 / 11 / 16 / 24

共同点:不会就不说,幻觉控制明显高于平均水平。主要问题不是乱答,而是把不少实际上可以继续查清楚的事实提前判成未知。

内部梯度:11最极端,接近“无可靠检索就拒答”;24有搜索但受工具/资源上限后大量降级;16是高质量保守版;08相对均衡。

可能的“同一底模不同工具权限”链条:11 → 24 → 16。

簇 E · 旧知识 + 报告生成型

02 / 03 / 06

共同点:表格和表达能力不差,但实时刷新弱。面对高速变化市场,容易用历史知识生成“看起来像当前”的报告。

内部差异:02最危险,证据不足也会继续补满;03最像“旧知识包装成当前审计报告”;06则更像摘要器,整理能力大于检索能力。

可能同源程度:中等。它们未必同模型,但至少表现出相近的“基座知识强、实时检索弱”模式。

簇 F · 顾问 / 个性化型

12

12是明显离群点。它最突出的是能把用户长期背景、架构、安全边界和既有工具栈带入建议,个性化顾问感远强于其他回答。

解释:这可能来自更强的长期记忆、用户画像、会话上下文注入,或者产品层Personalization,而不一定意味着底模完全不同。

独立性最高,但也最容易出现“底模其实相同、产品上下文层完全不同”的情况。

簇 G · 市场搜索 / 摘要型

14 / 15 / 23

共同点:会联网、信息量不小,但二手来源接受阈值高于“研究审计型”。更像搜很多网页后快速形成市场总结,而不是建立严格证据层级。

内部差异:14二手来源最重、甚至出现厂商归属串线;15搜索更广但最终仍由第三方资料驱动;23更成熟,知道写“约/通常”,但因此更像市场速览。

较强同源猜测:14 / 15 / 23 可能共享相近的Web Search + LLM Summary产品栈。

边缘 / 过渡型

01 / 04

01像受限搜索环境下的降级版本:会查,但资源不足后覆盖不足。04则是第一份真正进入候选池的“真实检索型”回答,介于基础搜索和成熟研究Agent之间。

强同源猜测(身份揭晓前)

猜测强度可能同源编号理由
很高18 / 19 / 20 / 22研究框架、长链路搜集、国内覆盖、后半段证据纪律松动方式高度相似。
很高10 / 16 / 21证据等级、官方优先、不确定性表达、Model-first纪律高度一致。
07 / 13 / 17Provider深挖、价格节点搜索、局部前沿但口径易混的特征接近。
中高05 / 09高召回、高覆盖、价格规则容易漂移;可能是簇C的邻近家族。
中高14 / 15 / 23二手来源接受度、搜索摘要式生成路径相似。
08 / 11 / 24保守、安全、低召回;可能对应同一底模在不同搜索权限下的表现。
02 / 03 / 06旧知识较强、实时检索较弱、报告生成能力大于事实刷新能力。
独立性高12个性化与长期上下文特征明显离群。

身份揭晓后最值得验证的三件事

  1. 同一模型跨平台,会不会比“不同模型同平台”更相似?
  2. 搜索工具/Research模式对最终质量的影响,是否大于底层模型本身?
  3. Deep Research / Pro / Thinking / 普通模式是否真的形成稳定可观察的能力层级?

这些结论比单纯“猜中品牌”更重要,因为它们直接关系到以后应该选模型、选平台,还是选搜索/研究模式。

IDENTITY REVEAL

身份揭晓:24 份回答的真实产品与模式

匿名评分、画像与聚类猜想全部保留不改。这里单独展示真实身份,用来检验:我们看到的究竟是底层模型指纹、平台指纹,还是搜索/研究模式指纹。

24 / 24 已揭晓匿名结论保留下一步:实名复盘

完整编号 → 产品/模式

编号产品入口 / 模式域名
01智谱清言普通入口chatglm.cn
02Z.ai Chat国际 Chatchat.z.ai
03BigModel Console开放平台控制台bigmodel.cn/console
04Kimikimi.aiwww.kimi.ai
05Kimikimi.comwww.kimi.com
06千问中文 Chatwww.qianwen.com/chat
07Qwen Chat国际 Chatchat.qwen.ai
08豆包默认 Chatwww.doubao.com/chat
09DolaChatwww.dola.com/chat
10腾讯元宝深度研究模式yuanbao.tencent.com/chat
11imaChatima.qq.com/chat
12GeminiGemini Appgemini.google.com
13Google AI StudioAI Studioaistudio.google.com
14Google Search AI ModeAI Modewww.google.com/search?sourceid=chrome&aep=42&atvm=2&udm=50
15秘塔 AI 搜索搜索metaso.cn/chat
16Perplexity搜索 / Researchwww.perplexity.ai
17腾讯元宝联网搜索yuanbao.tencent.com/chat
18Microsoft Copilot迭代研究m365.cloud.microsoft/chat
19腾讯元宝默认模式yuanbao.tencent.com/chat
20DeepSeekChatchat.deepseek.com
21ChatGPTChatGPTchatgpt.com
22腾讯元宝超级元宝yuanbao.tencent.com/chat
23GrokGrokgrok.com
24智谱清言补测完整显示chatglm.cn

实验条件补充:10 / 腾讯元宝

10号实际使用的是腾讯元宝“深度研究模式”,测试当时未在匿名答案中标注,因此此前一度被记录为普通元宝入口。现已按用户补充修正。

这使元宝形成完整四模式对照:深度研究 78 > 默认 72 > 超级元宝 66 > 联网搜索 61。对这类复杂市场调查,深度研究模式明显最适合;但“超级元宝”并没有优于默认模式。

最重要的同产品对照组

产品家族编号天然实验价值
智谱01 / 02 / 03 / 24清言、Z.ai、BigModel Console、刷新后补测:可比较同厂不同入口/完成状态。
Kimi04 / 05kimi.ai 与 kimi.com 两个入口,可观察同品牌不同站点/产品层差异。
千问 / Qwen06 / 07中文入口与国际 Qwen Chat 的差异。
腾讯元宝10 / 17 / 19 / 22深度研究、联网搜索、默认模式、超级元宝——本次最有价值的同产品多模式对照。
Google12 / 13 / 14Gemini App、AI Studio、Google Search AI Mode:同生态不同产品层的直接比较。

实验条件修正:18 / Microsoft Copilot

Copilot 首轮主动提示“这份调查只完成了约 25%–30% 的范围”。用户随后只发送了“继续补充”,没有提供新的事实、方向、标准或纠错信息。

因此:18 号应计为同一原始提示下的多轮自主研究,而不是“用户通过新增提示词帮助它完成答案”。最终比较时可以单独标注为“允许模型按自身提示继续完成”的迭代式研究样本。

揭晓后立即能确认的事情

  • 平台/模式影响非常大。同一厂商在不同入口的得分和画像可以差很多,单凭“文风”反推底模并不可靠。
  • 元宝是最好的天然实验。10 深度研究、17 联网搜索、19 默认模式、22 超级元宝构成完整四模式对照:深度研究最高,默认次之,超级元宝与联网搜索反而更低。
  • Google 生态也值得单独看。12 Gemini、13 AI Studio、14 Google Search AI Mode 可以帮助判断“同一模型/生态,不同产品层”究竟怎样改变检索行为。
  • 18 Copilot需要特殊标记。首轮由Copilot主动提示“这份调查只完成了约25%–30%的范围”,用户随后仅回复“继续补充”,没有增加任何新提示词、事实或判断标准。因此它更应视为同一任务下由模型自我识别覆盖不足后继续研究,而不是人为增强提示。
  • 21 = ChatGPT 是一个重要结果。匿名阶段它被画像为“证据驱动研究员型”,说明这次表现出来的更像研究/检索产品能力,而不仅是聊天模型能力。

揭晓前高置信猜测 vs 真相

揭晓前猜测真实结果结论
12 ≈ ChatGPT / OpenAIGemini错误;个性化/长期上下文感并不是 ChatGPT 独有指纹。
21 ≈ Perplexity ResearchChatGPT错误;证据驱动研究风格可能来自平台Research工具链,而非搜索品牌本身。
11 ≈ Claude 家族ima错误;极端保守/低幻觉更可能是产品层检索与回答策略。
18 / 19 / 20 / 22 至少两个同源19 / 22 均为腾讯元宝部分命中;聚类抓到了真实产品同源,但18=Copilot、20=DeepSeek。
10 / 16 / 21 至少两个共享高证据纪律家族10=元宝,16=Perplexity,21=ChatGPT品牌层未命中;说明“证据纪律”是跨产品可形成的研究模式,而不是独占模型指纹。

下一步

实名后不应只做“24个品牌排名”。更有价值的是同时做三层比较:产品排名、同厂不同模式对照、同类产品的角色定位。这样才能回答最终选型问题:到底该换模型、换平台,还是只需要切换搜索/研究模式。

FINAL NAMED COMPARISON

实名最终横向对比与选型建议

匿名评分、画像和聚类猜想均保留,不因身份揭晓而改分。本页把24份回答映射到真实产品,并额外考虑同产品多入口/多模式的稳定性。最终选型不是机械取最高分,而是结合你的真实需求:大陆公开网页召回、权威一手来源、时效性、引用可审计、低幻觉,以及API/产品研究能力。

24 / 24 已揭晓全球推荐:ChatGPT中国推荐:腾讯元宝

24份实名总排名(保留匿名阶段原始分)

排名编号产品入口/模式分数画像
121ChatGPTChatGPT84证据驱动研究员型
210腾讯元宝深度研究模式78证据优先审计型
320DeepSeekChat75新鲜全面型
405Kimikimi.com73均衡强检索型
519腾讯元宝默认模式72国内生态广覆盖型
613Google AI StudioAI Studio70广度深挖型
707Qwen Chat国际 Chat68强搜索弱收口型
818Microsoft Copilot迭代研究67迭代研究型
909DolaChat66高召回价格易漂移型
1022腾讯元宝超级元宝66资料重但锚点陈旧型
1116Perplexity搜索 / Research65保守审计型
1204Kimikimi.ai64真实检索入门型
1317腾讯元宝联网搜索61局部前沿但不同步型
1415秘塔 AI 搜索搜索58广搜二手收口型
1508豆包默认 Chat56谨慎研究型
1623GrokGrok54市场速览型
1712GeminiGemini App52上下文顾问型
1801智谱清言普通入口49受限搜索型
1924智谱清言补测完整显示46诚实低召回型
2014Google Search AI ModeAI Mode45二手来源驱动型
2111imaChat42零幻觉拒答型
2206千问中文 Chat27摘要大于检索型
2303BigModel Console开放平台控制台12旧知识包装型
2402Z.ai Chat国际 Chat11补全型幻觉
说明:分数保留匿名阶段原始评分,避免身份揭晓后“事后改卷”。最终产品推荐同时参考单次分数、同产品多模式稳定性和与你需求的互补度。

同产品 / 同生态多入口对照

产品家族编号分数均分揭示的问题
腾讯元宝10 / 17 / 19 / 2278 / 61 / 72 / 6669.3多模式样本最多;中国生态召回强,但模式间波动明显。默认/普通模式优于“超级元宝”并非偶然假设,需要按任务选模式。
Kimi04 / 0564 / 7368.5两个入口都进入中上区,kimi.com明显更强;中文研究与Agent潜力好。
Google12 / 13 / 1452 / 70 / 4555.7同生态差异巨大:AI Studio明显优于Gemini App与Search AI Mode,证明入口影响很大。
千问 / Qwen06 / 0727 / 6847.5国际Qwen Chat远好于中文入口这次表现,产品层差异非常大。
智谱01 / 02 / 03 / 2449 / 11 / 12 / 4629.5同厂不同入口差异极端;Z.ai/Console这次不适合当前事实检索,清言相对更稳但召回不足。

第一梯队:真正可作为主检索入口

ChatGPT 21 · 84:本轮综合第一。优势不是单纯“知道得多”,而是能继续查Help/Pricing/API/Provider边界并形成可审计证据链,最符合长期研究型检索Agent的要求。
腾讯元宝 深度研究10 · 78 / 默认19 · 72:中国平台里最有代表性的强检索表现;国内厂商、中文生态和本地网页覆盖突出。缺点是不同模式稳定性并不一致。
DeepSeek 20 · 75:最新海外/国内模型召回都很强,说明联网研究并不局限于国内信息;短板主要是会员帮助页和产品授权边界的最终核验。
Kimi 05 · 73 / Google AI Studio 13 · 70 / Qwen Chat 07 · 68 / Copilot 18 · 67:均具备明显可用价值,但各自存在证据收口、入口差异或需要多轮自主补充等限制。

最终选型:全球平台

推荐:ChatGPT

原因:21号84分是本轮最高,而且它的优势正好命中你的使用需求:权威来源优先、当前产品/价格核验、Help与API文档追踪、Provider与套餐边界、低幻觉和明确不确定性。更重要的是,你已经拥有ChatGPT Plus,因此继续把它作为全球主研究入口没有新增订阅成本。

为什么不是 Perplexity:16号65分的证据纪律不错,但这次过度保守、公开事实漏召回较多;作为二次核查或快速搜索仍有价值,但没有在这次复杂调查里超过ChatGPT。

为什么不是 Gemini:Google三入口最高是AI Studio 13号70分,但Gemini App 52、Search AI Mode 45,入口差异太大;既然你已经有Gemini付费,它更适合继续作为第二全球研究源,而不是替代ChatGPT成为唯一主入口。

最终选型:中国平台

推荐:腾讯元宝

原因:它是本轮中国平台中样本最多、最能体现中国本地检索价值的一组:10号78分、19号默认72分,国内模型与中文生态召回尤其强。它和ChatGPT形成的互补关系也比再选一个偏全球知识的产品更明确。

使用方式:日常快速查询优先默认模式;遇到这类需要跨厂商、跨价格页、跨证据链的复杂调查时,优先深度研究模式(10号78分,为元宝四种模式最高)。联网搜索适合作为轻量补充;“超级元宝”22号只有66分,说明“更重/更超级”并不自动意味着事实锚点和最终QC更准。

最接近的第二名:DeepSeek。20号75分,单次表现其实比元宝默认更高,而且全球最新AI信息召回非常漂亮。如果你的核心需求进一步从“大陆公开网页/中文生态”转向低价API + Coding + 中外技术情报,我会把中国推荐从元宝切换为DeepSeek。

你的最终两平台组合

角色推荐主要职责备用/复核
全球主研究入口ChatGPT全球产品、API、论文/文档、复杂研究、证据链、跨来源冲突处理Gemini / Perplexity
中国大陆主检索入口腾讯元宝大陆公开网页、国内厂商/政策/中文生态、快速本地事实召回DeepSeek / Kimi

这套组合的核心不是“两家最强模型”,而是两种检索生态互补:ChatGPT负责全球和严谨研究,元宝负责大陆中文公开网络;DeepSeek则保留为API/Coding和技术情报方向的强力候补。

几个重要的实验结论

  • 入口/模式影响可能大于底模:Google、元宝、智谱、Kimi、Qwen的同厂样本差异都非常明显。
  • “超级/Research”不保证更准:元宝内部呈现清晰梯度:深度研究10号78 > 默认19号72 > 超级元宝22号66 > 联网搜索17号61。更长或更重的模式并不必然更准,关键仍是检索策略与最终QC。
  • Copilot的多轮不是人为加提示:18号首轮自己声明只完成约25%–30%,用户仅回复“继续补充”。因此它体现的是模型自我识别覆盖不足后的迭代研究能力。
  • 匿名画像比品牌猜测更可靠:我们对“证据审计型、市场速览型、保守低召回型”等行为分类相当稳定,但靠这些风格反推具体品牌的成功率很低。