24 जून 2026

AI टोकन के लिए ज़्यादा खर्च करना बंद करें: वह लोकल-मॉडल स्टैक जिसने हमारा बिल 90% कम कर दिया

Andrea Borghi द्वारा
AI टोकन के लिए ज़्यादा खर्च करना बंद करें: वह लोकल-मॉडल स्टैक जिसने हमारा बिल 90% कम कर दिया

छह महीने पहले होस्टेड लैंग्वेज मॉडल्स पर हमारा मासिक बिल वह संख्या थी जो फाइनेंस से सवाल पूछवा देती थी। आज यह उसका दसवाँ हिस्सा है, और मॉडल्स हमारे हार्डवेयर पर पब्लिक इंटरनेट की तुलना में तेज़ हैं। हमने कोई डिस्काउंट नहीं माँगा। हमने सस्ते टियर पर स्विच नहीं किया। हमने मॉडल्स को अपने पास वापस ला लिया।

यह बदलाव एक प्रयोग के रूप में शुरू हुआ और एक स्टैक बन गया। हमारे नेटवर्क के एज पर एक सिंगल कंज़्यूमर-ग्रेड बॉक्स पर चलने वाले ओपन-वेट मॉडल्स का एक छोटा, अच्छी तरह चुना हुआ सेट अब हमारे अधिकांश इन्फरेंस ट्रैफ़िक को संभालता है। क्लाउड मॉडल्स अभी भी लूप में हैं, लेकिन केवल उन कामों के लिए जिन्हें सच में उनकी ज़रूरत होती है। बाकी सब कुछ लोकली चलता है, और बचत सीधे बॉटम लाइन तक जाती है।

पहला सबक यह था कि हर प्रॉम्प्ट के लिए बड़ा होना ज़रूरी नहीं है। 70-बिलियन-पैरामीटर वाला मॉडल प्रभावशाली है, लेकिन रूटीन सारांश, क्लासिफिकेशन और स्ट्रक्चर्ड एक्सट्रैक्शन के लिए यह ज़बरदस्त ओवरक्वालिफ़ाइड है। हमने असली ट्रैफ़िक की प्रोफ़ाइलिंग की और पाया कि लगभग दस में से सात रिक्वेस्ट रूटीन थीं। एक फाइन-ट्यून्ड 7-बिलियन-पैरामीटर मॉडल ने उन्हें लैटेंसी के एक अंश और शून्य प्रति-टोकन लागत पर संभाला। टास्क के हिसाब से रूटिंग, आदत के हिसाब से नहीं, यही अनलॉक था।

दूसरा सबक हार्डवेयर के बारे में था। हमने मान लिया था कि हमें एक्सेलेरेटर्स की एक रैक चाहिए होगी। व्यवहार में, एक ही मॉडर्न GPU जिसमें एक बार में दो या तीन क्वांटाइज़्ड मॉडल्स को आराम से रखने लायक VRAM थी, हमारे पीक लोड को आराम से कवर कर लेता था। चार-बिट वेट्स तक क्वांटाइज़ेशन से हमें क्वालिटी में मापने योग्य लेकिन स्वीकार्य गिरावट हुई और बदले में मेमोरी और थ्रूपुट की भारी बचत मिली। कम-प्राथमिकता वाले लॉन्ग-टेल जॉब्स के लिए, छोटे मॉडल के साथ CPU-ओनली फ़ॉलबैक ने सिस्टम को रिस्पॉन्सिव रखा जब GPU व्यस्त था।

तीसरा सबक कैशिंग के बारे में था। जब आप एक ही कॉन्टेक्स्ट विंडो को बार-बार फिर से इवैल्यूएट करते हैं तो टोकन लागत बढ़ती जाती है। हमने इन्फरेंस लेयर के सामने एक सिमैंटिक कैश जोड़ा ताकि नियर-डुप्लिकेट प्रॉम्प्ट्स बिना मॉडल को छुए स्टोर किया हुआ रिस्पॉन्स लौटाएँ। अनावश्यक इतिहास को हटाने वाले प्रॉम्प्ट टेम्प्लेटिंग के साथ मिलकर, कैश हिट रेट कुछ ही हफ़्तों में चालीस प्रतिशत से ऊपर पहुँच गई।

चौथा सबक ऑब्ज़र्वेबिलिटी के बारे में था। प्रति-मॉडल लैटेंसी, प्रति-मिलियन-टोकन लागत और क्वालिटी-स्पॉट-चेक डैशबोर्ड्स के बिना, ऑप्टिमाइज़ेशन अंदाज़े की बाज़ीगिरी है। हमने हर कॉल को इंस्ट्रूमेंट किया ताकि हम ठीक से देख सकें कि कौन से रूट लाभदायक हैं और कौन से चुपचाप बजट जला रहे हैं।

अगर आप एक ऐसे मॉडल बिल को देख रहे हैं जो अब उस वैल्यू से मेल नहीं खाता जो आपको मिलता है, तो रास्ता सीधा है। प्रोफ़ाइल करें कि आप असल में क्या भेजते हैं, मॉडल को टास्क के अनुसार सही साइज़ में लाएँ, जमकर क्वांटाइज़ करें, डुप्लिकेट कैश करें, और बेरोकटीपूर्वक मापते रहें। कठिन मामलों के लिए क्लाउड रहने दें। बाकी सब कुछ आपकी अपनी डेस्क पर चल सकता है।

उत्सुक हैं कि आपका ट्रैफ़िक इस तरह रूट होने पर कैसा दिखेगा? अपने शीर्ष तीन मॉडल उपयोग के मामलों के साथ रिप्लाई करें और हम उस रूटिंग ब्रेकडाउन को साझा करेंगे जिससे हम शुरुआत करेंगे।