技术、价格、稳定性,这三者若不能拧成一股绳,产品便撑不起用户的续费期待。
文/林书
硅谷的AI圈最近一个月热闹得有些过火。GPT-5.6、fable5、Grok-4.5这些名字接连登场,节奏快得让人喘不过气。
国内的开发者和程序员们瞬间被点燃,关于GPT-5.6等前沿模型的讨论和测评铺天盖地。
虽然这个月也冒出了Kimi-K3这样的国产新锐,但摆在台面上的现实是:在一线开发者眼里,国产大模型依旧陷在“叫好不叫座”的尴尬境地。
看调用量,数据确实漂亮。OpenRouter统计显示,6月22日到28日这一周,中国模型的调用量高达20.39万亿Token,美国模型只有4.25万亿。前者已经连续九周把后者甩在身后。
但营收这块,国内AI六小龙的表现却略显寒酸。翻看公开财报,智谱2025年营收7.24亿元,亏损额超过30亿元;MiniMax营收7900万美元(折合约5.7亿元);月之暗面等另外四家还没交出完整的年度成绩单。
哪怕是最头部的企业,收入也就停留在数亿这个量级。
再看对手Anthropic,这家AI巨头的ARR已经摸到了600亿到700亿美元的高位,主要靠B2B API和AI Coding场景驱动。
这反差太强烈,不得不让人问一个尖锐的问题:
明明号称“便宜”、“量大”的国产模型,为什么还是叫好不叫座?在AI Coding这种高价值场景里,为什么至今没法跟国外顶尖模型正面对抗?
经过和多位一线开发者的深入聊天,笔者发现了一个挺反直觉的事实:
某种程度上,国产大模型其实很“贵”。
正是这份隐形的“贵”,让那些在性能上有点突破的国产模型,很难真正发光发热。
01
“低价”的错觉
提到国产大模型,大家脑海里跳出来的通常是DeepSeek、Kimi、智谱这些名字。它们身上贴着一个最紧的标签:便宜。
单看Token单价,国产模型跟GPT-5.6、fable5这些顶级选手比,确实有优势。比如GLM-5.2和DeepSeek V4对比:GLM-5.2每百万Token输入1.4美元、输出4.4美元;DeepSeek-V4-Pro则是0.435美元和0.87美元。再看看GPT-5.6 Sol,输入5美元、输出30美元;Claude Fable 5更贵,10美元和50美元。
但这只是表象,是个圈外人长久的误区。
特别是在高强度的编程场景下,国产模型的单价不仅没优势,甚至比买了套餐的GPT、Claude还要贵出好几倍。
李光(化名)是AI领域的科研工作者。因为工作性质,他每天要在AI Coding里消耗几十亿Token。在这个消耗量级下,如果用国产模型,成本简直不敢想。
那天聊天的时候,李光晒出的账单显示,他当天消耗的Token已经接近40亿。咱们算笔账:假如他用的是GLM-5.2,成本大概是:(8639万普通输入×1.4美元+33.80亿缓存输入×0.26美元+1906万输出及推理×4.4美元),合计约1084美元。按1美元兑7.2元汇率算,差不多是人民币7800元。
李光敢这么放开手脚烧钱,是因为他开了GPT的CodeX套餐。
简单说,CodeX是针对编程场景推出的订阅服务。它不是真正的不限量,而是把Codex功能打包进ChatGPT订阅里:Plus版20美元/月,Pro版从100美元/月起,额度分别是Plus的5倍或20倍;额度用完了再买Credits继续用。
Anthropic的Claude Code也是类似套路:Claude Pro每月20美元,Max 5x和Max 20x分别是100美元和200美元/月。网页端和Code共享每5小时及每周的额度,超了按API价格续用。
有了套餐兜底,巨额Token成本就被抹平了。
对于国内开发者来说,高强度AI Coding时,每天消耗几十亿甚至上百亿Token,是很平常的事。
小刘也是个重度AI Coding开发者。他在Codex上实际一周花费300元人民币,这还是没公司报销的情况。
即便这样,跟国产模型比,依然显得“便宜”。同样的300元,根本买不到GLM 5.2同等数量的token。
在国内开发者看来,GPT的codex套餐是目前能买到的最便宜的token方案,比智谱、kimi便宜好几倍。这听起来反直觉,但事实就是:在高强度Coding场景下,国产模型的性价比完全没法跟人家比。
这里得澄清一点:codex并非真正不限量。按最高档200美元算,一周大概20亿额度。
不过,有些开发者会通过“中转站”等手段使用模型,某些渠道的实际成本比官方低很多。这就导致有时能用更低的价格买到更多Token,于是出现了300块买120亿Token的现象。
实际上,国产模型也不是没想过搞类似套餐。但细究起来,这类套餐在限额方面,跟codex相比限制多得多。
02
定价的痛点
国产大模型目前的定价现状,可以用一句话概括:
“你以为进了自助餐场子,最后发现商家还是按斤称。”
看套餐,国内的Kimi、GLM-5.2:Kimi Code分49、99、199、699元四档,额度按周刷新;GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt,每周约400、2000、8000次,而且GLM-5.2高峰期要扣3倍额度。
以阿里的qoder为例,笔者一位做B端运维的朋友阿迷(化名)吐槽:“qoder曾经是国内最好用的AI IDE,可惜新定价把优势作没了。”
套餐方面:Qoder CN个人Pro、Pro+分别是59、169元/月,含2000、6000 Credits;Teams与VPC版分别是99、199元/席位·月,都含3000 Credits,50席起售。
“今年他们合并灵码调定价后,至少二三十家放弃续费了。”阿迷后来补充道。
据阿迷测试,qoder企业版199元的套餐,按他的用法3天就耗尽了;如果是重度开发者,估计一天就没影了。
同样让国内用户五味杂陈的还有GLM-5.2的套餐。
开发者小薇直言:“GLM-5.2的套餐约等于没有。就算有,高峰期照样限流,还经常‘背刺’用户。”
36氪曾报道:GLM-5.2的套餐之前比演唱会门票还难抢,每天早上十点钟准时刷新,全凭手速。
到了2026年1月,智谱发公告称因算力紧张,每日可销售量直接砍到原来的20%,每天早上10点放一点额度,几分钟就卖光。
归根结底,国产模型在套餐和价格上的“吝啬”,本质是算力不足的窘迫。
2025年中国信通院和工信部的数据显示,中国现存数据中心449个,美国则有5427个。总算力方面,中国是1053 EFLOPS,美国是2400。
关键区别在于:美国那2,400 EFLOPS里,高端GPU占比极高;中国的算力中,大量是华为昇腾、寒武纪等国产芯片,单卡性能与H100仍有代差。
为了应对高涨的算力需求,2026年3月起,智谱、阿里云、腾讯云、百度集体涨价,涨幅从5%到460%不等。
说白了,国产模型的“低价”和“价格战”早就翻篇了。
不是不想搞自助模式,而是账算不过来:以现在的算力成本和亏损状态,搞包月等于拿固定月费赌用户不会刷爆。按照国内开发者动辄一天烧几十亿、上百亿Token的习惯,这种商业模式很快会被击穿成本线。
反观OpenAI和Anthropic,他们的编程套餐瞄准的是高净值企业客户——像Cursor、GitHub Copilot这样的大客户,一年能给Anthropic贡献14亿美元收入。
在高算力加持下,这套模式本质是用“固定月费”换“长期锁客”。客户质量高,ARPU相对高,成本自然摊得平。
相比之下,国内虽然有阿里这样的云巨头,但问题在于:阿里云FY2026调整后EBITA Margin只有7.5%。云智能集团收入增长虽快,利润却并不丰厚。
传统云厂商敢卖“不限量云服务器”,是因为用户不是24小时满负载运行。一台ECS,实际CPU利用率可能只有10%,云厂商可以把一台物理机超卖给十个人。
但大模型推理不一样:来一个token,就要实打实烧一次GPU算力。用户如果24小时不间断刷,云厂商的HBM显存、GPU核心、电费全是刚性支出,没有任何超卖空间。
03
模型的“黄金三角”
除了价格因素,对国内开发者而言,选择Codex、Calude Code的另一大理由,是它们强大的编程性能。
但在性能层面,国产模型也没像某些刻板印象中那样不堪。
跟多位开发者聊完后,笔者发现一个普遍观点:国产大模型,特别是GLM-5.2等最新款,已经能承接一些辅助性、次要的任务,比如写测试代码和修bug。
但在处理复杂、长时间的异步任务时,国产模型与GPT、Calude等顶尖模型相比,差距依然明显。
开发者小张今年3月份试用过一次国产模型编程。他用GLM、qwen和GPT跑同样的任务,结果只有GPT跑完了,且符合页面要求。那是一个多级、多列内容比对和结果生成的项目。
另一位开发者小薇则表示,根据她的体验,Kimi 2.7和豆包2.1 Pro性能尚可,但整体弱一档(属第二梯队),不过总体而言也超过了Claude Sonnet 4.6。
目前开发者群体的共识是:GLM-5.2是第一个达到Opus级别的国产模型。
在执行真实、复杂、长时间的异步任务中,它是可用的,占有一席之地。
尽管在世界知识等多个维度上,它与真正的Opus模型仍有较大差距,但这不妨碍它成为国产模型的新高度。
但现实很骨感:这几个刚刚崭露头角的“尖子生”,却被性能之外的因素拖累了。
具体包括缓存效率不高、高峰期依然限流等,导致开发者实际体验糟糕。
这就引出了当下模型对比中的另一个维度:稳定性。
在一线开发者眼里,选模型早已不是简单的性能PK,而是——
性能—价格—稳定性的“黄金三角”。
在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。
近期,国内Kimi发布了最新旗舰模型K3。这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型,主攻长程编程、知识工作与深度推理。
在众多测评中,它在Artificial Analysis上的智力指数为57分,位列全球第三;Arena前端编程榜以1679分登顶。甚至有传言称,其性能已能比肩Claude Fable 5。
但在耀眼的分数背后,开发者最关心的词只有一个:性价比。
K3发布后,不少开发者表示,现在Kimi依然很贵,跟Codex比没性价比,额度也不够用。单看API价格,K3算不上“白菜价”:每百万Token缓存/输入/输出分别为2/20/100元。相比之下,GPT-5.6 Sol为0.5/5/30美元,K3虽低于Sol,却明显高于GPT-5.6 Luna的0.1/1/6美元。
更糟的是,在使用K3的过程中,开发者反馈出现了API断连,甚至断了一上午的情况。
就目前来看,国内开发者并非不愿为国产模型付费,而是受限于算力紧缺和高成本,目前开不起Codex那样具性价比的套餐,只能提供看似自助餐、实则限量的“大众点评套餐”(类似智谱的Coding Plan)。
套餐体验不稳定、性价比模糊,导致用户用过就流失。这在当前算力底座成本高的背景下,其实是用户的理性选择。
以上种种,并非要长他人志气、灭自己威风,只是想提示一种风险。
目前国产模型在追赶GPT、Claude的路上,过于强调性能。但从研发到应用,国产大模型要攀登的,远不止性能这座高山。
我们需要等待。等到国产算力基座大规模量产,在技术、价格、稳定性方面形成合力时,我们的产品才能真正撑起用户的期待。

















