Flux
Couleur d'accent
L'économie cachée des LLM

L'économie cachée des LLM

OCTO Talks ·

Combien coûte vraiment un million de tokens quand on ne paie plus l’API, mais l’infrastructure qui les produit ? En partant du prefill, du decode, du batching, du KV cache et des modèles MoE, on estime combien de tokens une infrastructure GPU peut générer.

Soutenez OCTO Talks en consultant la ressource originale

Lire l'article original

Articles similaires

Cloud souverain : comprendre les règles du jeu en France et en Europe
Récent

Cloud souverain : comprendre les règles du jeu en France et en Europe

Cloud souverain : comprendre les règles du jeu en France et en EuropeNous utilisons tous des services cloud au quotidien. Pourtant, derrière le choix d'un fournisseur se cachent aujourd'hui des enjeux qui dépassent largement la technique : protection des données, dépendance aux grandes puissances technologiques, cybersécurité ou encore souverain

OCTO Talks
News août 2026 : Cursor Origin, requêtes HTTP, Lerd et modèles IA open-weight Podcast

News août 2026 : Cursor Origin, requêtes HTTP, Lerd et modèles IA open-weight

Nous évoquons WebMCP et Kitesurf que Cloudflare lance pour les agents IA, pnpm 12 réécrit en Rust, la méthode HTTP QUERY, Cursor qui passe à React et lance Origin, Mesa le filesystem versionné pour agents, Mistral et Hetzner côté IA souveraine, et quelques outils comme Xirp, Lerd, fx ou CodexBar. Retrouvez toutes les notes et les liens de l'épisode sur cette page : https://double-slash.dev/podcasts/news08-26/

Double Slash
Esc