22 जून 2026

स्थानीय AI मॉडल और कस्टम स्किल्स ने टोकन लागतों को 90% तक कैसे घटाया (और हमने क्यों स्विच किया)

Andrea Borghi द्वारा
स्थानीय AI मॉडल और कस्टम स्किल्स ने टोकन लागतों को 90% तक कैसे घटाया (और हमने क्यों स्विच किया)

हमारे होस्टेड मॉडल प्रदाता से आई आखिरी मासिक बिल $4,200 की थी, और उसका लगभग आधा खर्च ऐसा था जिसे हम किसी ग्राहक परिणाम से जोड़ नहीं पाए। उसी एक लाइन आइटम ने हमें यह पुनर्निर्माण करने के लिए प्रेरित किया कि हमारे आंतरिक एजेंट कैसे सोचते हैं, कैसे रूट करते हैं, और बुद्धिमत्ता के लिए कैसे भुगतान करते हैं। तीन महीने बाद, हम अधिक हल्के, तेज़, और सस्ते तरीके से काम कर रहे हैं — और कार्यपद्धति उतनी जटिल नहीं है जितनी कॉन्फ़्रेंस सर्किट इसे सुनाता है।

पहला बदलाव यह स्वीकार करना था कि हर काम के लिए फ्रंटियर मॉडल जरूरी नहीं होता। सरल वर्गीकरण, फ़ॉर्मेटिंग, और स्कीमा जांच को एक छोटे स्थानीय मॉडल पर रूट करने से हमारी अधिकांश मात्रा संभल गई, बिना उस सटीकता को खोए जहाँ वह महत्वपूर्ण थी। हमने महंगे होस्टेड कॉल्स को वास्तविक रूप से कठिन रीजनिंग कार्यों — रणनीति का ढाँचा बनाना, सूक्ष्म संश्लेषण, और किनारी मामले — के लिए आरक्षित रखा। सिद्धांत भले ही साधारण लगे, लेकिन शक्तिशाली है: कॉल की लागत को उत्तर के मूल्य से मिलाइए।

दूसरा बदलाव था एजेंट स्किल्स को चैट नहीं, बल्कि कोड मानना। हर स्किल एक छोटी, परीक्षण योग्य फ़ंक्शन है, जिसके इनपुट और आउटपुट स्पष्ट होते हैं। जब कोई स्किल अच्छी तरह परिभाषित होती है, तो एक छोटा स्थानीय मॉडल उसे भरोसेमंद तरीके से चला सकता है, और हम परिणाम को कैश कर सकते हैं। एक सप्ताह के भीतर, वही कैश किए गए और स्थानीय रूप से सर्व किए गए कॉल्स बचत को बढ़ाते हैं। होस्टेड मॉडल डिफ़ॉल्ट के बजाय एक बैकअप बन जाता है।

तीसरा, हमने टोकन्स को एक बजट की तरह मापा, न कि एक दिखावे के मीट्रिक की तरह। हमने हर वर्कफ़्लो में समाधान किए गए प्रति कार्य की लागत को ट्रैक किया और ऐसी किसी भी चीज़ को शिप करने से इनकार कर दिया जो किसी बेसलाइन से बेहतर न हो। इससे इस बारे में ईमानदार बातचीत करने की मजबूरी हुई कि कौन से प्रॉम्प्ट वास्तव में अपना भार उठा रहे थे और कौन से फ़िलर के लिए प्रीमियम कीमतें चुका रहे थे। हमारे पाइपलाइन में "इंटेलिजेंस" का आश्चर्यजनक रूप से बड़ा हिस्सा दोहरावदार, सामान्य टेक्स्ट था, जिसे 7B पैरामीटर वाला मॉडल आराम से संभाल लेता है।

चौथा, हमने हर एजेंट को जानबूझकर एस्केलेट करने की क्षमता दी। जब आत्मविश्वास कम हो, तो एक स्पष्ट, दस्तावेज़ित रास्ते के साथ लोकल-फर्स्ट, ताकि वह एक अधिक शक्तिशाली मॉडल तक जा सके। टीम सिस्टम पर भरोसा करती है क्योंकि एस्केप हैच वास्तविक है, और बजट भी सिस्टम पर भरोसा करता है क्योंकि अधिकांश कॉल्स वहाँ तक पहुँचती ही नहीं।

अंत में, हमने डेमो के लिए ऑप्टिमाइज़ करना बंद किया और मंगलवार दोपहर 2 बजे के लिए ऑप्टिमाइज़ करना शुरू किया। वास्तविक वर्कफ़्लोज़, वास्तविक लैटेंसी बजट, वास्तविक लागत सीमाएँ। यही वह जगह है जहाँ स्थानीय मॉडल और अनुशासित स्किल डिज़ाइन अपना खर्च वसूलते हैं।

अगर आप ऐसे उपयोग डैशबोर्ड को देख रहे हैं जो आपकी टीम द्वारा शिप किए जा रहे मूल्य से मेल नहीं खाता, तो आगे का रास्ता कोई और अनुबंध वार्ता नहीं है। अपने सबसे अधिक-आवृत्ति वाले कॉल्स का मानचित्र बनाइए, सरल वाले स्थानीय रूप से रूट कीजिए, बाकी को पुन: उपयोग योग्य स्किल्स के रूप में औपचारिक बनाइए, और हर वर्कफ़्लो पर एक वास्तविक प्रति-कार्य लागत संख्या लगाइए। 90% की कमी कोई मार्केटिंग दावा नहीं है — यह वही है जो तब निकलता है जब आप घरेलू कामों के लिए फ्रंटियर कीमतें देना बंद कर देते हैं।

क्या आप एक शुरुआती ऑडिट चेकलिस्ट चाहते हैं जिसका उपयोग हम आसान जीतों को ढूँढने के लिए करते हैं, इससे पहले कि हम इंफ्रास्ट्रक्चर के लिए प्रतिबद्ध हों? सब्सक्राइब करें और हम शुक्रवार को एक-पृष्ठीय वर्कशीट भेज देंगे।