[{"data":1,"prerenderedAt":364},["ShallowReactive",2],{"\u002F2025-07-20":3,"\u002F2025-07-20-rel":153},{"id":4,"title":5,"body":6,"column":136,"date":137,"description":12,"extension":138,"hero_image":139,"meta":140,"navigation":141,"path":142,"seo":143,"series_id":139,"severity":139,"stem":144,"summary":145,"tags":146,"__hash__":152},"posts\u002F2025-07-20-五个模型我都熟只用一个.md","五个模型我都熟，只用一个",{"type":7,"value":8,"toc":127},"minimark",[9,13,16,19,23,26,29,32,35,43,46,52,58,64,70,73,76,79,82,85,88,91,97,100,103,106,109,112,118,121,124],[10,11,12],"p",{},"从 o1 发布那会儿开始碰 AI，到现在快一年。Claude、GPT、Gemini、GLM、Kimi 这几家我都实际用过一段时间，不是试两句就走的那种熟。",[10,14,15],{},"然后日常固定只用其中一个。",[10,17,18],{},"这跟到处能看到的建议是反的——那些建议大意都是\"按任务选模型\"：长文档分析用这家、写代码用那家、要便宜用另一家。听起来很合理，是把每个任务都放到最擅长它的模型上。我试过这么干，后来放弃了。",[20,21,22],"h2",{"id":22},"不是因为其他模型不行",[10,24,25],{},"得先把这句说清楚，否则下面全是偏见。",[10,27,28],{},"这五家在我用过的任务上都能干活，各自也确实有明显更强的地方。如果把单个任务孤立出来比，\"按任务分派\"的结论是对的——某类任务上换一家，产出确实更好一点。",[10,30,31],{},"问题是任务并不孤立存在。",[20,33,34],{"id":34},"切换成本不在模型上",[10,36,37,38,42],{},"真正的成本不是学会用一个新模型——那很快，几小时就能上手。成本在于",[39,40,41],"strong",{},"围绕单一工具沉淀下来的那些东西，换模型就得重建","。",[10,44,45],{},"至少有四样：",[10,47,48,51],{},[39,49,50],{},"一套写规则的习惯。"," 用久了就知道这个模型对什么样的指令反应准，哪种表述会被忽略，哪些约束必须重复强调它才当真。这些不是通用的 prompt 技巧，是针对具体模型的。换一家，重新摸。",[10,53,54,57],{},[39,55,56],{},"对它失败模式的直觉。"," 这一条最值钱，也最难迁移。用久了会形成一种预感：这个任务它大概会在哪一步跑偏、什么样的回答是\"它其实没懂但在硬答\"、哪种沉默意味着上下文不够。这种直觉让我能在它出错之前就介入。换模型之后，直觉全部失效——而且是无声失效，你不知道自己已经不准了，只会觉得\"最近怎么老出问题\"。",[10,59,60,63],{},[39,61,62],{},"上下文的组织方式。"," 给多少、按什么顺序给、什么该放开头、什么放结尾、哪些信息其实是噪音。这些在不同模型上的最优解不一样。",[10,65,66,69],{},[39,67,68],{},"命令与工作流的肌肉记忆。"," 这个最琐碎，但每天都在消耗。",[10,71,72],{},"四样加起来，换模型的真实代价是把这些重新长一遍。而收益，是某类任务上的边际提升。",[10,74,75],{},"这笔账在多数时候是不划算的。",[20,77,78],{"id":78},"分派本身也有成本",[10,80,81],{},"还有一层容易被忽略：即使不算沉淀成本，\"按任务分派\"本身也不免费。",[10,83,84],{},"每个任务开始前多了一个决策：这个该给谁。这个决策不难，但它是持续的、高频的、而且经常做不准——因为一个任务的难点往往在做的过程中才暴露出来，事前分派依据的是对任务的初始判断，而初始判断经常是错的。",[10,86,87],{},"于是会出现更糟的情况：任务开到一半发现选错了，换一家重做。此时前面积累的上下文全部作废，因为它在另一个会话里。",[20,89,90],{"id":90},"什么时候值得切换",[10,92,93,94],{},"不是永远不换。判据是：",[39,95,96],{},"它在我的主力场景上有代际差距，而不是某个单点更强。",[10,98,99],{},"单点更强不值得动——比如某家的长文档处理明显好，但我一周只做两次长文档分析，为这个把主力工作流迁走，账算不平。",[10,101,102],{},"代际差距值得动——如果某家在\"理解一个中等复杂度的代码库并做出正确修改\"这件事上明显进了一档，那该换，因为这就是我 80% 的时间花的地方，沉淀成本会被摊平。",[10,104,105],{},"区别在于那个能力是不是压在主路径上。",[20,107,108],{"id":108},"一个更一般的判断",[10,110,111],{},"这件事想通之后，我看工具选型的角度变了。",[10,113,114,115],{},"以前会比参数、比榜单、比某几个 case 的产出质量。现在会先问另一个问题：",[39,116,117],{},"我能在这个东西上面沉淀多深？",[10,119,120],{},"能沉淀得深的工具，即使起点不是最强的那个，一年之后的实际产出也会超过一直在换的那种。因为沉淀是复利，而每次切换都把利息清零。",[10,122,123],{},"反过来，如果一个工具让我沉淀不下任何东西——每次用都像第一次用——那它多强都只是个临时的外援，不构成能力。",[10,125,126],{},"这也解释了为什么\"用哪个模型\"这个问题被问得太多，而\"你在它上面攒下了什么\"几乎没人问。后者才是差距真正拉开的地方。",{"title":128,"searchDepth":129,"depth":129,"links":130},"",2,[131,132,133,134,135],{"id":22,"depth":129,"text":22},{"id":34,"depth":129,"text":34},{"id":78,"depth":129,"text":78},{"id":90,"depth":129,"text":90},{"id":108,"depth":129,"text":108},"工具链观察","2025-07-20","md",null,{},true,"\u002F2025-07-20",{"title":5,"description":12},"2025-07-20-五个模型我都熟只用一个","Claude、GPT、Gemini、GLM、Kimi 都用熟了，日常固定只用一个。切换模型的真实成本不在学习模型本身，而在重建围绕它沉淀的一切。",[147,148,149,150,151],"AI 编程","模型选型","工具链","Claude","迁移成本","RYfIUu2g7SajwWGxT566_tQuNPrz69n3WeD4dchs_ho",[154,275],{"id":155,"title":156,"body":157,"column":136,"date":263,"description":161,"extension":138,"hero_image":139,"meta":264,"navigation":141,"path":265,"seo":266,"series_id":139,"severity":139,"stem":267,"summary":268,"tags":269,"__hash__":274},"posts\u002F2025-09-14-那5%我不交给AI.md","那 5%，我不交给 AI",{"type":7,"value":158,"toc":257},[159,162,165,169,172,175,178,181,184,188,191,194,197,200,203,207,210,213,216,219,226,229,232,238,251,254],[10,160,161],{},"用 AI 写代码一年多，交出去的比例一直在涨。但有三类工作我始终自己做，不是还没轮到它们，是明确不交。",[10,163,164],{},"这条线比\"AI 能干什么\"更值得写。能力清单每隔几个月就过期一次，而边界为什么在这里，理由是稳定的。",[20,166,168],{"id":167},"第一类架构设计","第一类：架构设计",[10,170,171],{},"不是说 AI 给不出架构方案——它给得出，而且通常看起来很合理：分层清晰、职责分明、扩展点齐全。",[10,173,174],{},"问题在于合理的方案可能是错的。",[10,176,177],{},"架构决策依赖两样东西：对业务往哪走的判断，以及对历史包袱的了解。前者在我脑子里都未必清楚，更不在上下文里；后者是一堆\"当初为什么这么做\"的历史，散落在几年的提交记录、废弃的分支、和某次线上事故之后加的一个 workaround 里。这些东西没法塞进对话。",[10,179,180],{},"于是会得到一个技术上自洽、但在具体处境里错误的方案。它不违反任何原则，只是不适合这个项目。而这类错误的代价是最高的——写错的函数改起来是几十行，选错的架构改起来是几个月。",[10,182,183],{},"我的做法是：架构自己定，定完让 AI 挑毛病。让它扮演一个不了解历史的新人来审——它确实就是。它提的问题里，一部分是我已经权衡过的（那说明我的文档没写清），一部分是我真的漏了。这个用法比让它出方案有价值得多。",[20,185,187],{"id":186},"第二类它试了几轮还没解决的问题","第二类：它试了几轮还没解决的问题",[10,189,190],{},"这一类不是按任务性质划的，是按过程判定的。",[10,192,193],{},"同样是\"修一个 bug\"，有时候 AI 两三轮就搞定，有时候十轮还在原地打转。而事前看不出区别——难点常常不在描述里。所以先验分类没什么用，我改用一个事后判据：给它固定几轮，不收敛就自己接手。",[10,195,196],{},"不收敛的样子挺好认：反复改同一处、每轮都给一个新解释但都不对、或者开始建议重写一些明明无关的代码。最后那个信号最明确——它在扩大搜索范围，因为在原范围里已经找不到解了。",[10,198,199],{},"这时候接手，第一件事不是自己从头写，而是找它缺的那条信息。多轮不收敛几乎总意味着关键事实不在它能看到的范围内：一个没被提及的环境差异、一份没给它的日志、一个只有我知道的历史约定。补上那一条，往往剩下的它自己就能做完。",[10,201,202],{},"真正需要我从头写的情况很少。绝大多数\"AI 搞不定\"其实是\"我没给够\"。",[20,204,206],{"id":205},"第三类极高风险操作","第三类：极高风险操作",[10,208,209],{},"发版、删数据、改生产配置。",[10,211,212],{},"这三件事的共同点不是难，是不可逆且影响面大。判断的依据不该是 AI 做得对不对——它大概率做得对——而是做错一次的代价。一个函数写错，测试会拦住，最差是回滚一个提交。一次删错数据，回滚的对象是用户的东西。",[10,214,215],{},"这里面的不对称很关键：AI 在这类操作上的正确率可能比我高（它不会漏步骤、不会记错顺序、不会因为做过一百遍就跳过检查）。但正确率高不代表可以授权，因为失败的代价不由它承担。",[10,217,218],{},"我确实有过一次事故：AI 删掉了数据。恢复它靠的是备份——我一直在做大量备份，那次照常有一份可用的。",[10,220,221,222,225],{},"事后我想的不是\"以后要更小心\"，而是另一件事：",[39,223,224],{},"如果那次没有备份，这个边界就根本不存在","。我之所以敢把大部分工作交出去，前提是错了能回来。没有兜底的授权不是信任，是赌博——而赌赢过几次的人最容易把它误认为信任。",[10,227,228],{},"所以这条边界真正的支撑不是我不让 AI 碰这些操作，而是我在它碰得到的地方都留了退路。前者是纪律，后者是基础设施。纪律会松，基础设施不会。",[20,230,231],{"id":231},"三条线的共同点",[10,233,234,235,42],{},"回头看这三类，划线的依据其实是同一个问题：",[39,236,237],{},"出错的时候，谁能发现，以及能不能回来",[239,240,241,245,248],"ul",{},[242,243,244],"li",{},"架构错误：很晚才能发现，而且几乎回不来",[242,246,247],{},"多轮不收敛：立刻能发现（它自己在原地转圈），随时能回来",[242,249,250],{},"高风险操作：可能立刻发现，但回不回来取决于有没有备份",[10,252,253],{},"中间那一类之所以可以交给 AI 试，正是因为它失败得很明显、很便宜。而另外两类，一个是发现得太晚，一个是回不了头。",[10,255,256],{},"这个判据比\"哪些任务适合 AI\"更耐用。任务类型会变，模型能力会涨，但\"错了能不能发现、能不能回来\"这两个问题永远得先答。",{"title":128,"searchDepth":129,"depth":129,"links":258},[259,260,261,262],{"id":167,"depth":129,"text":168},{"id":186,"depth":129,"text":187},{"id":205,"depth":129,"text":206},{"id":231,"depth":129,"text":231},"2025-09-14",{},"\u002F2025-09-14-5percentai",{"title":156,"description":161},"2025-09-14-那5%我不交给AI","绝大部分开发工作可以交给 AI，但有三类明确不交：架构设计、AI 多轮未解决的问题、极高风险操作。边界比能力更能说明判断力。",[147,270,271,272,273],"工作边界","风险控制","备份策略","架构决策","B4TC5bxguSoGpmQZ8NDmriLk4_0Iqgk9TWIJsitPCIQ",{"id":4,"title":5,"body":276,"column":136,"date":137,"description":12,"extension":138,"hero_image":139,"meta":361,"navigation":141,"path":142,"seo":362,"series_id":139,"severity":139,"stem":144,"summary":145,"tags":363,"__hash__":152},{"type":7,"value":277,"toc":354},[278,280,282,284,286,288,290,292,294,298,300,304,308,312,316,318,320,322,324,326,328,330,334,336,338,340,342,344,348,350,352],[10,279,12],{},[10,281,15],{},[10,283,18],{},[20,285,22],{"id":22},[10,287,25],{},[10,289,28],{},[10,291,31],{},[20,293,34],{"id":34},[10,295,37,296,42],{},[39,297,41],{},[10,299,45],{},[10,301,302,51],{},[39,303,50],{},[10,305,306,57],{},[39,307,56],{},[10,309,310,63],{},[39,311,62],{},[10,313,314,69],{},[39,315,68],{},[10,317,72],{},[10,319,75],{},[20,321,78],{"id":78},[10,323,81],{},[10,325,84],{},[10,327,87],{},[20,329,90],{"id":90},[10,331,93,332],{},[39,333,96],{},[10,335,99],{},[10,337,102],{},[10,339,105],{},[20,341,108],{"id":108},[10,343,111],{},[10,345,114,346],{},[39,347,117],{},[10,349,120],{},[10,351,123],{},[10,353,126],{},{"title":128,"searchDepth":129,"depth":129,"links":355},[356,357,358,359,360],{"id":22,"depth":129,"text":22},{"id":34,"depth":129,"text":34},{"id":78,"depth":129,"text":78},{"id":90,"depth":129,"text":90},{"id":108,"depth":129,"text":108},{},{"title":5,"description":12},[147,148,149,150,151],1785406912451]