RAG : sortir les décisions du LLM avec un moteur typé

TypeSafe AI a publié Jev le 15 septembre 2026. Le modèle lit un contexte et rend une décision dans un format que vous fixez d'avance, avec une probabilité. Il n'écrit pas de texte.
Votre assistant documentaire passe son temps à trancher des questions fermées. Vous les confiez toutes au modèle le plus lent et le plus cher de la chaîne.
Les décisions que votre RAG confie au LLM
Un assistant qui répond à partir de vos documents cherche dans la base, retient des passages, puis rédige. Les architectures agentiques ferment la boucle en vérifiant la réponse avant de l'afficher.
Votre modèle génératif assure tout, y compris les arbitrages qui n'ont rien de rédactionnel :
- faut-il chercher dans la base, ou répondre directement ?
- ce passage a-t-il un rapport avec la question ?
- les sources appuient-elles la réponse rédigée ?
Vous payez ces questions fermées au token généré, et votre utilisateur les attend mot après mot.
Les trois formats de réponse de Jev
Noul rend la probabilité qu'un énoncé soit vrai, entre 0 et 1. Choice tranche parmi 1 à 255 options et rend une probabilité par option, avec un indice de confiance. Score situe l'entrée sur une échelle ordonnée de 2 à 10 niveaux et rend un score continu, sa distribution et une confiance.
Jev évalue en parallèle toutes les questions d'une même requête. Vous en ajoutez une, le temps de réponse bouge à peine et vous payez ses tokens d'entrée.
Vous branchez ces sorties dans votre code sans analyser de texte ni rattraper un format. Demandez « oui ou non » à un LLM, vous recevrez un paragraphe à découper.
Trois points d'insertion dans la boucle
Avant la recherche. Beaucoup de questions ne justifient aucune requête dans la base. Un Noul ou un Choice décide s'il faut chercher, répondre directement, passer la main à un humain ou refuser. Chaque recherche évitée vous épargne un appel au moteur vectoriel et un appel au LLM.
Entre la recherche et la rédaction. Votre recherche vectorielle remonte quelques dizaines de passages, dont une partie hors sujet. Un Score note chaque passage face à la question, et vous ne transmettez que les meilleurs au LLM. Le contexte raccourcit et votre facture baisse.
Après la rédaction. Un Noul compare la réponse aux passages sources, un Score donne un niveau de confiance. Sous votre seuil, vous relancez la boucle ou affichez un message de repli plutôt qu'une réponse inventée.
Le LLM garde ce qu'il fait bien, comprendre une demande et écrire une réponse. Vous lui retirez les arbitrages.
Les chiffres publiés
TypeSafe annonce 70 à 500 millisecondes de bout en bout, contre 3 à 329 secondes pour les modèles de discussion qu'ils ont mesurés sur la même tâche. Ils facturent 0,042 dollar par million de tokens en entrée, ne facturent pas la sortie, et arrivent à 0,0004 dollar par cas sur leur banc d'essai.
L'éditeur produit ces chiffres. Deux praticiens en ont publié d'autres. Guillermo Rauch, de Vercel, mesure jusqu'à 18 fois plus rapide au p95 que GPT Luna. Nikhil Mudholkar, de Bryo AI, trouve Gemini un peu plus juste sur du tri d'e-mails, pour 10 à 20 fois plus cher.
Vous appelez le modèle par un SDK Python ou JavaScript, ou par Cloudflare Workers AI, Vercel AI Gateway et OpenRouter. Il n'accepte pas d'image en entrée et ne compte pas.
La garantie de schéma et ses limites
TypeSafe garantit la conformité au schéma : la réponse tombe dans les valeurs que vous avez définies. Le 0 % affiché décrit cette garantie de format, et non un taux d'erreur mesuré.
Le modèle vous rend donc une valeur valide, qui peut être fausse. Un passage hors sujet récolte parfois une bonne note. Une réponse que les sources n'appuient pas franchit parfois la validation.
Une décision fausse reste tout de même exploitable par votre code, avec une probabilité attachée et un seuil à régler. Pour mesurer la justesse sur vos propres documents, il vous faut un jeu de cas de test.
Le conseil Upted
Le produit a six jours. Testez-le sur un cas isolé avant de le mettre devant un client.
Commencez par la décision qui part le plus souvent chez votre LLM, en général le tri des passages. Mesurez avant et après le temps de réponse, le coût par question et le taux de réponses correctes sur un jeu de cas que vous aurez figé.
Votre gain suit le nombre d'arbitrages que votre chaîne confie aujourd'hui à un modèle génératif. Un assistant qui fait un seul appel n'y gagnera rien. Une boucle agentique qui en fait six y gagnera beaucoup.
Comptez le coût du montage : un fournisseur de plus, une clé à gérer, une facturation à l'appel à surveiller, et un service de plus qui peut tomber. Vous réglez ces questions dans vos flux automatisés, au même endroit que la traçabilité qu'exige l'AI Act sur les décisions prises par une machine.
Où en est votre référencement, techniquement ? 30 minutes, sans engagement.
Demander mon diagnostic
