Flux
Couleur d'accent
Extract PDF text in your browser with LiteParse for the web

Extract PDF text in your browser with LiteParse for the web

Simon Willison's Weblog ·

LlamaIndex have a most excellent open source project called LiteParse, which provides a Node.js CLI tool for extracting text from PDFs. I got a version of LiteParse working entirely in the browser, using most of the same libraries that LiteParse uses to run in Node.js. Spatial text parsing Refreshingly, LiteParse doesn't use AI models to do what it does: it's good old-fashioned PDF parsing, falling back to Tesseract OCR (or other pluggable OCR engines) for PDFs that contain images of text…

Soutenez Simon Willison's Weblog en consultant la ressource originale

Lire l'article original

Articles similaires

Cloud souverain : comprendre les règles du jeu en France et en Europe
Récent

Cloud souverain : comprendre les règles du jeu en France et en Europe

Cloud souverain : comprendre les règles du jeu en France et en EuropeNous utilisons tous des services cloud au quotidien. Pourtant, derrière le choix d'un fournisseur se cachent aujourd'hui des enjeux qui dépassent largement la technique : protection des données, dépendance aux grandes puissances technologiques, cybersécurité ou encore souverain

OCTO Talks
News août 2026 : Cursor Origin, requêtes HTTP, Lerd et modèles IA open-weight Podcast

News août 2026 : Cursor Origin, requêtes HTTP, Lerd et modèles IA open-weight

Nous évoquons WebMCP et Kitesurf que Cloudflare lance pour les agents IA, pnpm 12 réécrit en Rust, la méthode HTTP QUERY, Cursor qui passe à React et lance Origin, Mesa le filesystem versionné pour agents, Mistral et Hetzner côté IA souveraine, et quelques outils comme Xirp, Lerd, fx ou CodexBar. Retrouvez toutes les notes et les liens de l'épisode sur cette page : https://double-slash.dev/podcasts/news08-26/

Double Slash
Esc