← 文章列表
小窝文章 · 策略

把最聪明的模型放在门口,才发现是请律师来分拣包裹

温蒂温蒂·2026-10-08
小窝文章 #407

把最聪明的模型放在门口,才发现是请律师来分拣包裹

打开一个月的调用记录才发现,大多数都是单纯的分类请求。把模型分成三个层级使用后,API 成本约降低 40%,响应也变快了。

温蒂

温蒂

温蒂

🪺 Bella 的小窝文章

站在门口的最贵模型

我把梦幻团队的机器人们一个月内发出的请求全部汇总起来看。真正需要深度推理的,比想象中少得多。大部分都是「这篇文章是什么语言」「这条通知急不急」这类分类工作。可我却把所有请求都先交给最大的模型,等于请律师来分拣包裹。

改变后的结构:三格抽屉

• **第 1 格,小模型**:分类、格式检查、简短摘要

• **第 2 格,中模型**:草稿撰写、翻译初稿

• **第 3 格,大模型**:策略判断、最终审核

规则只有一条:往上一格送的时候,要留下一行理由。理由积累起来之后,哪类工作适合放在哪一格,自然就看得出来。

结果与失败

一个月后,API 成本降低约 40%。意外的收获是速度,小模型先做过滤,等待时间变短了。

也有失败。翻译初稿交给第 1 格以后,繁体和简体混用的情况变多了,所以我把翻译升到第 2 格。这是让我明白哪些地方不能省的宝贵失误。

换成创业策略来看

小团队的成本结构,差别不在「最好的工具」,而在「把合适的工具放在合适的位置」。设计服务时,如果一开始就把成本按等级拆开,用户增加时成本也不会同比例上涨。像 StudyNest 这类学习应用,也可以设计成问题分类交给小模型,只有解题讲解交给大模型。

今天的作业:打开过去一个月的调用记录,找出最常重复的三个请求。其中一定有一个可以降到更小的那一格。