从 o1 发布那会儿开始碰 AI,到现在快一年。Claude、GPT、Gemini、GLM、Kimi 这几家我都实际用过一段时间,不是试两句就走的那种熟。
然后日常固定只用其中一个。
这跟到处能看到的建议是反的——那些建议大意都是"按任务选模型":长文档分析用这家、写代码用那家、要便宜用另一家。听起来很合理,是把每个任务都放到最擅长它的模型上。我试过这么干,后来放弃了。
不是因为其他模型不行
得先把这句说清楚,否则下面全是偏见。
这五家在我用过的任务上都能干活,各自也确实有明显更强的地方。如果把单个任务孤立出来比,"按任务分派"的结论是对的——某类任务上换一家,产出确实更好一点。
问题是任务并不孤立存在。
切换成本不在模型上
真正的成本不是学会用一个新模型——那很快,几小时就能上手。成本在于围绕单一工具沉淀下来的那些东西,换模型就得重建。
至少有四样:
一套写规则的习惯。 用久了就知道这个模型对什么样的指令反应准,哪种表述会被忽略,哪些约束必须重复强调它才当真。这些不是通用的 prompt 技巧,是针对具体模型的。换一家,重新摸。
对它失败模式的直觉。 这一条最值钱,也最难迁移。用久了会形成一种预感:这个任务它大概会在哪一步跑偏、什么样的回答是"它其实没懂但在硬答"、哪种沉默意味着上下文不够。这种直觉让我能在它出错之前就介入。换模型之后,直觉全部失效——而且是无声失效,你不知道自己已经不准了,只会觉得"最近怎么老出问题"。
上下文的组织方式。 给多少、按什么顺序给、什么该放开头、什么放结尾、哪些信息其实是噪音。这些在不同模型上的最优解不一样。
命令与工作流的肌肉记忆。 这个最琐碎,但每天都在消耗。
四样加起来,换模型的真实代价是把这些重新长一遍。而收益,是某类任务上的边际提升。
这笔账在多数时候是不划算的。
分派本身也有成本
还有一层容易被忽略:即使不算沉淀成本,"按任务分派"本身也不免费。
每个任务开始前多了一个决策:这个该给谁。这个决策不难,但它是持续的、高频的、而且经常做不准——因为一个任务的难点往往在做的过程中才暴露出来,事前分派依据的是对任务的初始判断,而初始判断经常是错的。
于是会出现更糟的情况:任务开到一半发现选错了,换一家重做。此时前面积累的上下文全部作废,因为它在另一个会话里。
什么时候值得切换
不是永远不换。判据是:它在我的主力场景上有代际差距,而不是某个单点更强。
单点更强不值得动——比如某家的长文档处理明显好,但我一周只做两次长文档分析,为这个把主力工作流迁走,账算不平。
代际差距值得动——如果某家在"理解一个中等复杂度的代码库并做出正确修改"这件事上明显进了一档,那该换,因为这就是我 80% 的时间花的地方,沉淀成本会被摊平。
区别在于那个能力是不是压在主路径上。
一个更一般的判断
这件事想通之后,我看工具选型的角度变了。
以前会比参数、比榜单、比某几个 case 的产出质量。现在会先问另一个问题:我能在这个东西上面沉淀多深?
能沉淀得深的工具,即使起点不是最强的那个,一年之后的实际产出也会超过一直在换的那种。因为沉淀是复利,而每次切换都把利息清零。
反过来,如果一个工具让我沉淀不下任何东西——每次用都像第一次用——那它多强都只是个临时的外援,不构成能力。
这也解释了为什么"用哪个模型"这个问题被问得太多,而"你在它上面攒下了什么"几乎没人问。后者才是差距真正拉开的地方。
■