La nostra ultima fattura mensile da un fornitore di modelli ospitati è arrivata a 4.200 $, e quasi la metà di quella spesa non era ricondicibile a un risultato per il cliente. Quella singola voce di costo ci ha spinto a ricostruire il modo in cui i nostri agenti interni pensano, instradano e pagano l'intelligenza. Tre mesi dopo, stiamo lavorando in modo più snello, più rapido e più economico — e il playbook è più semplice di come lo presenta il circuito delle conferenze.
Il primo cambiamento è stato ammettere che non ogni attività merita un modello di frontiera. Instradare classificazioni semplici, operazioni di formattazione e controlli dello schema verso un piccolo modello locale ha gestito la parte più consistente del nostro volume senza perdere accuratezza dove contava. Abbiamo riservato le chiamate costose al modello ospitato per il lavoro di ragionamento davvero difficile — inquadratura strategica, sintesi sfumate e casi limite. Il principio è poco brillante ma potente: far corrispondere il costo della chiamata al valore della risposta.
Il secondo cambiamento è stato trattare le competenze degli agenti come codice, non come chat. Ogni competenza è una piccola funzione testabile, con input e output espliciti. Quando una competenza è ben definita, un piccolo modello locale può eseguirla in modo affidabile, e possiamo metterne in cache il risultato. Nell'arco di una settimana, quelle chiamate servite localmente e dalla cache sono dove i risparmi si accumulano. Il modello ospitato diventa un fallback, non l'impostazione predefinita.
In terzo luogo, abbiamo misurato i token come un budget, non come una metrica di vanità. Abbiamo tracciato il costo per attività risolta in ogni flusso di lavoro e ci siamo rifiutati di rilasciare qualsiasi cosa che non battesse una baseline. Questo ha forzato conversazioni oneste su quali prompt stessero effettivamente tirando il loro peso e quali stessero pagando prezzi premium per riempitivo. Una quantità sorprendente di "intelligenza" nella nostra pipeline era boilerplate ripetitivo che un modello da 7B parametri gestisce comodamente.
In quarto luogo, abbiamo dato a ogni agente la possibilità di escalation in modo deliberato. Approccio local-first, con un percorso chiaro e documentato verso un modello più potente quando la confidenza è bassa. Il team si fida del sistema perché la via d'uscita è reale, e il budget si fida del sistema perché la maggior parte delle chiamate non ci arriva mai.
Infine, abbiamo smesso di ottimizzare per la demo e abbiamo iniziato a ottimizzare per il martedì alle 14:00. Flussi di lavoro reali, budget di latenza reali, tetti di costo reali. È qui che i modelli locali e una progettazione disciplinata delle competenze si guadagnano il loro valore.
Se stai fissando una dashboard di utilizzo che non si riconcilia con il valore che il tuo team sta rilasciando, la strada da percorrere non è un'altra negoziazione di contratto. Inizia mappando le chiamate a maggior volume, instrada quelle semplici localmente, formalizza il resto come competenze riutilizzabili e metti un numero reale di costo per attività su ogni flusso di lavoro. La riduzione del 90% non è un'affermazione di marketing — è ciò che emerge quando smetti di pagare prezzi da frontiera per faccende di routine.
Vuoi una checklist di audit introduttiva che usiamo per trovare i guadagni facili prima di impegnarti con l'infrastruttura? Iscriviti e venerdì ti invieremo il worksheet di una pagina.
