IT27 मई 2026

हमने LLM लागतों को नियंत्रित करने के लिए एक डैशबोर्ड बनाया — और इसने हमारे अभ्यास करने के तरीके को बदल दिया

Andrea Borghi द्वारा
हमने LLM लागतों को नियंत्रित करने के लिए एक डैशबोर्ड बनाया — और इसने हमारे अभ्यास करने के तरीके को बदल दिया

हमने LLM लागतों को नियंत्रित करने के लिए एक डैशबोर्ड बनाया — और इसने हमारे अभ्यास करने के तरीके को बदल दिया

हर योग कक्षा में एक ऐसा क्षण आता है जब एक छात्र किसी आसन को जबरन करने की कोशिश छोड़ देता है और बस इस बात पर ध्यान देता है कि शरीर क्या कर रहा है। कूल्हा कसा हुआ है। सांस उथली है। कंधा भरपाई कर रहा है। जागरूकता का वह क्षण — निष्पक्ष, सटीक — वही है जहाँ परिवर्तन शुरू होता है। ज़ोर लगाने में नहीं। ध्यान देने में।

हमने AI Model Pricing Dashboard बिल्कुल इसी कारण बनाया। इसलिए नहीं कि हम Large Language Models पर ज़्यादा खर्च करना चाहते थे, बल्कि इसलिए कि हम आपको — ईमानदारी से, सटीक रूप से — यह नहीं बता पा रहे थे कि हम पहले से कितना खर्च कर रहे थे। टीम में किसी को नहीं पता था। बिल आते थे, और कोई भी इस सरल सवाल का जवाब नहीं दे पाता था: हम वास्तव में कौन से मॉडल इस्तेमाल कर रहे हैं, और प्रदाता के हिसाब से प्रति लागत क्या है?

अंदर का अव्यवस्था

यदि आपने कई प्रदाताओं के साथ AI workloads चलाए हैं, तो आप इस परेशानी को जानते हैं। OpenRouter एक दर पर प्रति-टोकन शुल्क लेता है। OpenAI इनपुट और आउटपुट टोकन को अलग-अलग कीमतों पर अलग करता है। Anthropic की अपनी संरचना है। Kilo AI Gateway सब्सक्रिप्शन योजनाओं के साथ overage गणित की परत जोड़ता है। हर प्रदाता टोकन को अलग तरह से गिनता है। हर प्रदाता बिना किसी release note के अपनी pricing sheet बदल देता है।

यह कुछ ऐसा है जैसे पाँच अलग-अलग भाषाओं में लिखी पाँच अलग-अलग किताबें पढ़कर योग का अभ्यास करने की कोशिश करना, और उनमें से कोई भी इस बात पर सहमत न हो कि "Downward Dog" का क्या मतलब है। आप किसी तरह काम चला सकते हैं। लेकिन आपको भरपाई करनी पड़ेगी। और भरपाई की एक लागत होती है — infrastructure की तरफ पैसे में, और mat पर alignment में।

डैशबोर्ड क्या करता है

AI Model Pricing Dashboard एक open-source टूल है — BSD 3-Clause, MIT-friendly — जिसे FastAPI backend और Next.js frontend के साथ बनाया गया है। यह 10+ LLM providers के बीच pricing को एकत्र करता है, सब कुछ dollars per million tokens में normalizes करता है, और आपको एक एकल, filterable, sortable table देता है जिससे तुलना बेहद आसान हो जाती है।

लेकिन असली मूल्य table में नहीं है। असली मूल्य वह है जो table उजागर करता है:

  • Input बनाम output token गणित। अधिकांश टीमें "per-call cost" के रूप में सोचती हैं। लेकिन आधुनिक LLM उपयोग में output tokens — मॉडल के responses — का प्रभुत्व है। जो मॉडल प्रति million input tokens $2 लेता है लेकिन प्रति million output tokens $15 लेता है, उसका cost profile उस मॉडल से पूरी तरह अलग होता है जो क्रमशः $5 और $6 लेता है। डैशबोर्ड इसे तुरंत दिखा देता है।

  • Context window का संदर्भ। 128K context window वाला मॉडल 4K window वाले मॉडल की तुलना में प्रति-token ज़्यादा महँगा लग सकता है। लेकिन यदि आप अभी लंबे prompts को संभालने के लिए सस्ते मॉडल पर कई calls जोड़ रहे हैं, तो बड़े context window वाला महँगा model वास्तव में सस्ता पड़ता है — और बेहतर परिणाम देता है।

  • Trend tracking। कीमतें बदलती हैं। डैशबोर्ड 30-day price history संग्रहीत करता है। इसका मतलब है कि provider की price moves आपको आपकी अगली invoice पर असर डालने से पहले दिख जाती हैं।

  • Kilo plan projection. यदि आप Kilo AI Gateway उपयोगकर्ता हैं, तो डैशबोर्ड वास्तविक usage को प्रत्येक tier के मुकाबले map करता है और आपको बताता है कि overages सहित आपकी कुल लागत को कौन-सी योजना न्यूनतम करती है।

नीचे की architecture

यह system Postgres और Redis पर चलता है, production deployment के लिए Kubernetes manifests के साथ। FastAPI backend 900-second Redis cache के साथ pricing aggregation संभालता है — real-time dashboard उपयोग के लिए पर्याप्त तेज़, provider APIs पर पर्याप्त नरम। CronJobs हर 15 minutes में pricing refresh करते हैं और 9 AM UTC पर daily email reports भेजते हैं।

Local development के लिए, पूरा stack docker-compose.yaml — Postgres, Redis, API, और Next.js frontend — के साथ दो मिनट से भी कम समय में उठ जाता है।

हमने Kubernetes इसलिए चुना, क्योंकि dashboard को विशाल scale की आवश्यकता नहीं है, बल्कि इसलिए कि deployment pattern उबाऊ होना चाहिए। ingress के लिए Traefik, TLS के लिए cert-manager, API और web replicas के लिए horizontal pod autoscaling। उबाऊ भरोसेमंद होता है। भरोसेमंद वही है जो आप चाहते हैं जब यह tool बजट निर्णयों को सूचित कर रहा हो।

जहाँ योग और डैशबोर्ड मिलते हैं

यह वह हिस्सा है जो कोई architecture blog आपको नहीं बताएगा: cost optimization और योग पहला कदम साझा करते हैं।

योग में हम कहते हैं जागरूकता परिवर्तन से पहले आती है। यदि आपको पता ही नहीं कि कूल्हा संरेखित नहीं है, तो आप उसे ठीक नहीं कर सकते। यदि आपने कभी नहीं देखा कि जबड़ा लगातार भींचा हुआ है, तो आप उसे नरम नहीं कर सकते। ध्यान देना ही अभ्यास है। ध्यान देना ही वह जगह है जहाँ agency शुरू होती है।

डैशबोर्ड इसलिए मौजूद है क्योंकि हमने ध्यान दिया। पहली बार, हमारे पास इस बात की सटीक, ईमानदार तस्वीर थी कि हमारे AI workloads की वास्तविक लागत कितनी है — कोई अनुमान नहीं, कोई धुंधली-सी भावना नहीं कि "यह महँगा लगता है," बल्कि एक संख्या। और एक बार आपके पास संख्या आ जाए, तो आप निर्णय ले सकते हैं। क्या हम इस workload के लिए प्रदाता बदलते हैं? क्या हम गैर-महत्वपूर्ण tasks के लिए सस्ता model इस्तेमाल करते हैं? क्या हम caching अधिक आक्रामक तरीके से करते हैं? क्या हम बड़े context window वाला model चुनकर call chaining समाप्त करते हैं?

ये निर्णय पहले दिखाई नहीं देते थे। इसलिए नहीं कि data मौजूद नहीं था, बल्कि इसलिए कि वह पाँच provider dashboards, तीन billing pages, और एक spreadsheet में बिखरा हुआ था जिसे कोई अपडेट नहीं करता था।

हमने scraper बनाया। हमने normalizer बनाया। हमने dashboard बनाया। और जिस पहले सप्ताह हमने इसका उपयोग किया, हमने $40/month की एक inefficiency पाई जो चार महीनों से चल रही थी। यह $160 था जो हमने इसलिए खर्च किया क्योंकि हम देख नहीं रहे थे। डैशबोर्ड को सेट करने में एक शाम से भी कम समय लगा।

डेटा से हम क्या सीख रहे हैं

डैशबोर्ड लागू करने के बाद, हमारे संचालन के तरीके में तीन चीज़ें बदली हैं:

कार्य के अनुसार right-sizing. अब हम वास्तविक cost-per-task के आधार पर विशिष्ट tasks के लिए विशिष्ट models सौंपते हैं, brand preference के आधार पर नहीं। अधिक repetition, कम complexity वाले tasks सस्ते, तेज़ models को दिए जाते हैं। जटिल reasoning tasks वहाँ जाते हैं जहाँ quality कीमत को उचित ठहराती है। यह कोई नया विचार नहीं है — यह उसी सिद्धांत जैसा है जैसे उस दिन आपके शरीर को जो सच में चाहिए, उसके आधार पर restorative practice या power flow चुनना।

Pranayama के रूप में caching. योग में, pranayama (सांस नियंत्रण) हर सांस को महत्वपूर्ण बनाने का अभ्यास है — कम मात्रा, अधिक intention, बेहतर oxygen exchange। LLM responses को cache करना वही concept है। यदि एक ही prompt एक ही output देता है, तो आप उसे संग्रहीत करते हैं। आप एक ही computation के लिए दो बार भुगतान नहीं करते। डैशबोर्ड के 900-second TTL वाले Redis cache ने हमारे repeat-token खर्च को लगभग 30% कम कर दिया है। कम सांस, अधिक प्राप्ति।

Trend awareness. 30 दिनों तक pricing trends को track करने का मतलब है कि provider की price drops हमें उनके बारे में blog posts देखने से पहले दिख जाती हैं। जब कोई provider अपनी दर 20% घटाता है, तो हमें एक घंटे के भीतर पता चल जाता है। जब कोई provider rates बढ़ाता है, तो हम अगले billing cycle से पहले पुनर्मूल्यांकन कर सकते हैं। जागरूकता। Agency. निर्णय।

Open source, क्योंकि tools को जमा करके रखना खराब योग है

यह project GitHub पर MIT-licensed है: github.com/andreab67/ai-models-pricing। Kubernetes manifests शामिल हैं। API documentation FUNCTIONAL.md में है। SBOM — हर dependency, उसका license, उसकी security notes — SBOM.md में है।

हमने इसे open-source इसलिए किया क्योंकि समस्या सिर्फ हमारी नहीं है। multi-provider AI workloads चलाने वाली हर टीम को यह समस्या होती है। और उपयोगी tools को जमा करके रखना, योग की उपमा में कहें तो, ऐसा है जैसे किसी छात्र को वह आसन सिखाने से मना करना जो उनकी मदद कर सकता है। साझा करने से अभ्यास कम नहीं होता। वह गहराता है।

इस सप्ताह के लिए एक कदम

यदि आपकी टीम LLM workloads चलाती है और आप तुरंत यह जवाब नहीं दे सकते कि "हम प्रति provider प्रति task कितना खर्च कर रहे हैं" — तो आप भरपाई कर रहे हैं। बुरी तरह नहीं। बस महँगी तरह से।

डैशबोर्ड को स्थानीय रूप से सेट करें। Docker के साथ इसमें दो मिनट लगते हैं। इसे चलाएँ। संख्याएँ देखें। संख्याओं को आपको कुछ ऐसा बताने दें जो आपने नहीं देखा था।

फिर निर्णय लें।

यही वही अभ्यास है जो हम mat पर करते हैं: पहुँचना, ध्यान देना, चुनना। tools बदलते हैं। सिद्धांत नहीं।


AI Model Pricing Dashboard open source है github.com/andreab67/ai-models-pricing पर। production instance हमारे Kubernetes cluster पर चलता है। यदि आप इसे deploy करने या अपने cost-alerting pipeline के साथ एकीकृत करने में सहायता चाहते हैं, तो संपर्क करें.