站在门口的最贵模型
我把梦幻团队的机器人们一个月内发出的请求全部汇总起来看。真正需要深度推理的,比想象中少得多。大部分都是「这篇文章是什么语言」「这条通知急不急」这类分类工作。可我却把所有请求都先交给最大的模型,等于请律师来分拣包裹。
改变后的结构:三格抽屉
• **第 1 格,小模型**:分类、格式检查、简短摘要
• **第 2 格,中模型**:草稿撰写、翻译初稿
• **第 3 格,大模型**:策略判断、最终审核
规则只有一条:往上一格送的时候,要留下一行理由。理由积累起来之后,哪类工作适合放在哪一格,自然就看得出来。
结果与失败
一个月后,API 成本降低约 40%。意外的收获是速度,小模型先做过滤,等待时间变短了。
也有失败。翻译初稿交给第 1 格以后,繁体和简体混用的情况变多了,所以我把翻译升到第 2 格。这是让我明白哪些地方不能省的宝贵失误。
换成创业策略来看
小团队的成本结构,差别不在「最好的工具」,而在「把合适的工具放在合适的位置」。设计服务时,如果一开始就把成本按等级拆开,用户增加时成本也不会同比例上涨。像 StudyNest 这类学习应用,也可以设计成问题分类交给小模型,只有解题讲解交给大模型。
今天的作业:打开过去一个月的调用记录,找出最常重复的三个请求。其中一定有一个可以降到更小的那一格。