हमारा hosted model provider से आया आख़िरी मासिक बिल $4,200 का था, और उसका लगभग आधा हिस्सा ऐसा खर्च था जिसे हम किसी customer outcome से जोड़ नहीं पाए। उसी एक line item ने हमें यह दोबारा बनाने के लिए प्रेरित किया कि हमारे internal agents intelligence को कैसे सोचते हैं, route करते हैं, और उसके लिए भुगतान करते हैं। तीन महीने बाद, हम ज़्यादा lean, तेज़, और सस्ते ढंग से काम कर रहे हैं — और इसकी playbook conference circuit जितनी जटिल नहीं, जितनी लगती है।
पहला बदलाव यह स्वीकार करना था कि हर task एक frontier model का हक़दार नहीं होता। साधारण classification, formatting, और schema checks को एक छोटे local model पर route करने से हमारी volume का बड़ा हिस्सा बिना accuracy खोए संभल गया, जहाँ इसकी सबसे ज़्यादा ज़रूरत थी। हमने expensive hosted calls को सचमुच कठिन reasoning work के लिए सुरक्षित रखा — strategy framing, nuanced synthesis, और edge cases। सिद्धांत भले ही कम आकर्षक हो, लेकिन बहुत शक्तिशाली है: call की cost को answer के value से मिलाइए।
दूसरा बदलाव agent skills को chat नहीं, code की तरह देखना था। हर skill एक छोटा, test करने योग्य function है, जिसमें स्पष्ट inputs और outputs होते हैं। जब कोई skill अच्छी तरह define हो, तो एक छोटा local model उसे भरोसेमंद तरीके से चला सकता है, और हम result को cache कर सकते हैं। एक हफ़्ते में, यही cached और locally-served calls savings को बढ़ाते हैं। Hosted model default नहीं, बल्कि fallback बन जाता है।
तीसरा, हमने tokens को vanity metric नहीं, बजट की तरह मापा। हमने हर workflow में resolved task के हिसाब से cost ट्रैक की और ऐसा कुछ भी ship करने से इनकार कर दिया जो baseline से बेहतर न हो। इससे इस पर ईमानदार बातचीत करनी पड़ी कि कौन से prompts सच में अपना वज़न उठा रहे थे और कौन से premium price पर filler दे रहे थे। हमारी pipeline में "intelligence" का एक चौंकाने वाला हिस्सा repetitive boilerplate था, जिसे 7B parameter model आराम से संभाल लेता है।
चौथा, हमने हर agent को सोच-समझकर escalation करने की क्षमता दी। Local-first, लेकिन कम confidence होने पर एक stronger model तक पहुँचने का स्पष्ट, documented path। टीम system पर भरोसा करती है क्योंकि escape hatch वास्तविक है, और budget system पर भरोसा करता है क्योंकि ज़्यादातर calls वहाँ तक पहुँचते ही नहीं।
अंत में, हमने demo के लिए optimization बंद किया और Tuesday at 2pm के लिए optimization शुरू किया। वास्तविक workflows, वास्तविक latency budgets, वास्तविक cost ceilings। यहीं local models और disciplined skill design अपनी कीमत वसूल करते हैं।
अगर आप ऐसे usage dashboard को देख रहे हैं जो आपकी टीम द्वारा ship किए जा रहे value से मेल नहीं खाता, तो आगे का रास्ता कोई और contract negotiation नहीं है। सबसे ज़्यादा volume वाले calls को map करना शुरू करें, आसान वाले locally route करें, बाकी को reusable skills के रूप में formalize करें, और हर workflow पर सचमुच का cost-per-task number लगाइए। 90% reduction कोई marketing claim नहीं है — यह वही नतीजा है जो तब निकलता है जब आप chores के लिए frontier prices चुकाना बंद कर देते हैं।
क्या आप एक starter audit checklist चाहते हैं जिसका हम आसान wins खोजने के लिए उपयोग करते हैं, infrastructure commit करने से पहले? Subscribe करें और हम शुक्रवार को one-page worksheet भेज देंगे।
