VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

AI MARKET GUIDE

便宜模型真的便宜吗?我用Python脚本给Gemini 3.8、Luna、DeepSeek V4算了笔账

V2EX上有人争论便宜模型哪家强,Gemini 3.8、GPT-5.6 Luna、DeepSeek V4 Pro谁更值。但很少有人真去算账单。我搭了个轻量Python监控脚本,把每次调用的输入输出比、缓存命中、工具调用次数全记下来,结果发现「便宜」在某些场景反而是陷阱。这篇讲怎么复现这套账,以及我踩过的坑。

先说个让我脸疼的事

上周我在V2EX刷到一个帖子,标题就叫「便宜模型哪家强? Gemini 3.8 Flash GPT-5.6 Luna DeepSeek V4」。

楼主贴了个DeepSWE的排名:Gemini 3.8 > Luna > DepSeek V4 Pro,问大家实际体验咋样。

底下有个叫Cabana的老哥回得特别实在。他说自己拿同一个任务、同样的提示词、同样的 /goal 去跑,Gemini 3.8 十多分钟就搞定了,Luna 跑了两个多小时还没完,被他手动停掉了。

再下面还有一句更扎心的评论:「你这价格也是天差地别。我当时就愣了一下。

因为我自己前段时间刚犯过一个错——为了省钱,把一个批量处理任务从贵模型换到了标称单价更低的模型。换完那几天我还挺得意,觉得省了。

直到月底看账单,我人傻了。便宜模型那一栏的花费,比我之前用的还高。

问题出在哪?不是单价,是我根本没搞清楚「单价便宜」和「这个任务花的钱便宜」压根是两回事。

跑得慢、输出啰嗦、缓存命中低、工具调用一遍又一遍,这些都在悄悄把账单撑起来,而定价表上一个字都不会告诉你。

所以这篇不聊官方定价表,不搬评测跑分。我就讲一件事:我怎么用一个Python小脚本,把这三个模型在我自己真实场景下到底花了多少钱,一笔一笔记清楚。

「便宜」这个词,藏了至少四个变量

先把账拆开。大家说某个模型便宜,通常指的是每百万token的输入或输出单价低。

但真实账单是这么算的:

实际花费 ≈ 输入token × 输入单价 + 输出token × 输出单价 −(命中缓存省下的部分)+ 每次工具调用带来的额外来回。

这里面有四个你平时看不见的变量:

第一,输入输出比例。有的模型嘴碎,同样一个问题它能给你输出三倍长度的答案。

输出token往往比输入贵好几倍,嘴一碎,账单立刻鼓起来。

第二,缓存命中率。如果你的场景有大量重复前缀(比如固定的system prompt、重复的上下文),缓存命中能省下一大截。

但换了模型或者请求结构变了,命中率可能直接掉到底,你以为省了,其实全按原价走。

第三,工具调用次数。做Agent的都懂,一次任务可能要来回调好几轮工具。

模型「聪明」的话两三轮解决,「不太行」的话它反复试错、反复调,每一轮都是新的一笔token。

第四,也是最容易被忽略的——耗时背后的隐性成本。 Cabana那个例子里,Luna跑了两小时没跑完。

就算它单价再低,两小时里烧掉的token和你的时间,都是真金白银。

光讲道理没用。我的做法是:别信感觉,把每一次调用都落到一张表里,跑一周,然后看账。

我是怎么把这套监控搭起来的

说实话,一开始我想搞得很复杂,什么可视化面板、实时告警。折腾了半天发现没必要,独立开发者要的是快速验证逻辑,不是造轮子。

我的思路就三步:拦截每次模型调用的返回、把关键字段抽出来、写进一张本地表。

核心逻辑我是直接在Python在线运行里先跑通的。好处是不用在本地折腾环境、装依赖,我把解析返回、计算单次成本的函数贴进去,喂几条模拟的返回数据,几秒钟就能看出逻辑对不对。

等确认字段抽取和成本公式没问题了,再接到真实调用上,省了我大量在本地反复调试的时间。

我记录的字段大概长这样(里只是我用的结构,字段名你随意):调用时间、模型名、输入token、输出token、是否命中缓存、本次工具调用轮数、本次估算成本。每次调用完,往表里塞一行。

这张表我用SQLite存。原因很简单:轻、无依赖、一个文件走天下,特别适合这种个人监控场景。

跑了一周之后,我想看哪个模型在「长输出任务」里最贵,直接用SQLite编辑器打开表,按模型分组、把输出token和估算成本加总,一眼就看出来了,连额外写查询脚本的功夫都省了。表结构不对、某个字段忘了记,也是在这里当场改。

如果你之前没怎么碰过这类调用日志的处理,或者对token计费的底层逻辑还有点懵,我建议先补一补AI编程相关的基础,把「一次API调用到底发生了什么」搞明白,再来做监控,会顺很多。

跑完一周,我推翻了自己之前的判断

这里必须说清楚:下面这些是我在自己特定场景下跑出来的趋势判断,不是通用结论,具体到你的任务不一定成立。而且我手上没有可对外公开验证的完整账单数据,所以任何精确的金额、百分比数字我都标成【待核实】,不硬编。

先说和帖子一致的部分:在偏「解决问题、跑任务」的场景里,Gemini 3.8 确实又快又利索的体感是有的,这点和Cabana、和DeepSWE那个排名对得上。跑得快,往意味着工具调用轮数少、试错少,间接就省钱。

但反转来了。在我另一类「要求长文本输出」的场景里,标称单价低的那个模型反而把账单顶上去了。

原因就是前面说的输出token——它输出特别长,而且缓存命中率在我这个请求结构下低得可怜【具体命中率数字待核实】。单价便宜的优势,被输出量和低命中率一口吃掉还倒贴。

还有一个我没想到的点:工具调用频繁的Agent任务里,「便宜模型」有时候要多试好几轮才走对路。表面每token便宜,架不住它调用次数翻倍【具体倍数待核实】。

这时候贵一点但一次到位的模型,总账反而更划算。

所以我现在的判断很明确:别问「哪个模型最便宜」,要问「我这个具体任务,用哪个模型的总账最便宜」。这两个问题的答案,经常是反的。

顺便说个题外的坑

补一句和成本无关但很多人栽过的事。就算你选好了模型,也别忘了确认自己的账号地区和网络能不能正常调用。

我看到有人 Google AI Pro 账号在新加坡地区调 Gemini 直接报 FAILED_PRECONDITION、地区不支持,最后发现是节点问题。这种坑跟便宜不便宜没关系,但能让你一整天白忙,值得提前排查。

你今天就能做的一个小动作

不用一上来就搭完整监控。今天你就可以干一件事:找你最常跑的那个任务,拿两个模型各跑一次,把这次的输入token、输出token、工具调用轮数手动记下来,用各自的单价乘一下,算出这一次到底花了多少。

就这一次对比,很可能就颠覆你对「便宜」的直觉。等你觉得手动记太烦了,再把它变成脚本、落进表里,这套东西自然就长出来了。

说真的,选模型这事,感觉最不靠谱。账单不会骗人,先把账算明白再说。