先说个让我愣了一下的产品
前几天刷到有人分享了一个叫 Vidily 的站,专门整理 AI 视频、图片、音频模型的供应商、公开价格和使用条件。我第一反应特别不屑:扒价格谁不会啊,写个爬虫半天搞定。
结果我自己动手试了试,想把三四家视频生成 API 的价格列个表对比一下,折腾到一半就卡住了。 A 家按秒计费,还分 Standard 和 Pro 两档,带不带音频价格不一样;B 家按次计费,但一次默认出几秒含糊不清;图片模型是按张算的,音频又回到按时长。
我盯着自己记的那张乱七八糟的表,突然意识到——我原来想的方向整个错了。
难的根本不是把数字抄下来。数字到处都是,供应商官网明码标价。
真正难、也真正值钱的,是把这些口径完全不一样的条件,对齐成一个能横着比较的结构。 Vidily 那条帖子里有句话我琢磨了半天:它特意把分辨率、时长、档位、是否带音频这些条件放在价格旁边,再给个供应商页面方便回去核对。
这不是技术活,这是判断活。
公开信息不是护城河,整理过的信息才是
我见过太多独立开发者一上来就纠结爬虫怎么写、反爬怎么绕。但在比价这件事上,爬虫是最不重要的部分。
你想想,一个 AI API 的价格页,谁都能打开看。信息本身是公开的、免费的、零门槛的。
如果你做的只是把公开价格原样搬过来,那你没有创造任何东西,用户为什么要来你这而不是直接去官网?
价值发生在你把它们"对齐"的那一刻。当我把 A 家的"每秒 Standard 不含音频"和 B 家的"每次含 5 秒含音频"换算到同一个口径下,让用户能一眼看出到底谁更划算——这个换算逻辑、这套字段设计,才是别人抄不走的东西。
公开价格是原料,对齐后的结构才是产品。
这个判断对独立开发者特别关键。因为我们没资源去拼大而全,但垂直领域里"口径混乱"造成的信息差,恰恰是小团队能啃下来的硬骨头。
市场里那个代充 GPT、那个讨论 6.1 和 5.6 哪个强、哪个更便宜的帖子,背后其实都是同一个痛点:大家被一堆不对齐的信息绕晕了,愿意为"有人帮我理清楚"买单。
别本以为抓到数据就赢了
我自己踩的最大的坑,是本以为把数据抓全就算完成了,结果发现抓完才是真正麻烦的开始。
抓下来的原始数据是文本,"$0.05/second"、"按张 0.02 美元"、"1080p Pro 档含音频",格式各式各样。你得写一堆清洗规则,把它们解析成统一的字段:计费单位、单价、分辨率、时长、档位、是否含音频。
这个清洗过程特别琐碎,而且供应商改一次页面你就得跟着调一次。
我是直接在 Python在线运行 里一边抓一边调清洗逻辑的,好处是改完规则马上能看到解析结果对不对,不用在本地反复配环境。遇到某家价格格式特别刁钻,就单独写个解析分支,跑一遍看看字段落位准不准。
这种打开就能验证的节奏,比在本地折腾部署舒服太多。
清洗完我把结果塞进 SQLite,一个模型一行,字段固定下来。为什么用 SQLite 不用更重的数据库?
因为这个场景数据量不大,核心是"结构化"而不是"高并发"。而且调试阶段我经常要翻表看字段对不对、哪条解析错了,用 SQLite编辑器 直接把表拉出来扫一眼就行,哪条数据脏了一目了然,比写 SQL 查快多了。
价格对齐这件事,表结构设计对了,产品就成了一半。
做成"打开就能查"的站,而不是一次性脚本
这里有个容易被忽略的分水岭:你是做了个自己用的脚本,还是做了个别人能用的产品?
区别在交付形态。脚本是跑完出个结果就完了;产品是用户随时打开、随时能查、而且你得保证数据相对新。
Vidily 做得聪明的地方在于,它不光给对比,还给了供应商页面、成本计算器、价格历史入口,而且浏览比较信息不需要登录——降低门槛,让人进来就能用。
我的做法是把那张 SQLite 里的价格表包成一个网页,用户选模型、选条件,页面实时算给他看谁便宜。做好之后直接用 Web应用托管 发出去,拿到一个能分享的链接。
这样它就不再是我硬盘里的一个脚本,而是一个任何人点开链接就能查的站。
从脚本到产品,技术上没增加多少,但商业形态完全变了。前者只有你受益,后者能长期活下去、能积累用户、甚至能变现。
关于"宣传就被抄"这件事,我的真实看法
市场里有个帖子在纠结:出海盈利的产品回国宣传,是拓展市场还是自招抄袭?说现在 Vibe Coding 这么普及,复刻成本极低,一宣传就引来一堆像素级搬运。
我不否认这个担心,但放在比价站这个场景,我觉得被高估了。
抄界面、抄爬虫确实几分钟的事。但你抄不走的是什么?
是我持续维护数据新鲜度的那套清洗规则,是我对这个垂直领域条件口径的理解,是我盯着供应商改版及时跟进的那份勤快。比价站的壁垒从来不在代码,而在"你愿不愿意长期把这件脏活累活做下去"。
像素级搬运工复制一个静态快照很容易,但两周后数据过期、价格对不上,用户照样跑回我这。
说真的,一次性能抄走的东西,本来也不值钱。真正的护城河是时间 + 持续维护,这恰恰是搬运工最不耐烦干的。
如果你今天就想试
别一上来就想做覆盖所有模型的大平台。挑一个你自己真接过、被价格坑过的细分领域——比如就做视频生成 API,或者就做语音转文字。
先手动整理五六家供应商的价格,重点不是抓取,是搞清楚它们的计费口径差在哪、怎么对齐成同一个单位。这一步你用 Excel 都行,目的是先验证"对齐逻辑"立不立得住。
等逻辑想明白了,再谈抓取、存储、发布。
信息差做成产品的核心,从来不是技术堆料,是你比别人更早看清"哪里乱、乱在哪、怎么理顺"。先把那张对齐后的表做出来,剩下的都是水到渠成的事。