Een lange PDF laten uitlezen zonder hem eerst op te knippen
Baidu publiceerde een open-source OCR-model dat tientallen pagina's binnen een contextvenster van 32.768 tokens kan verwerken. Wat het wel en niet kan en welke hardware de officiële route gebruikt.
Wie regelmatig gescande documenten uitleest, kent het patroon: je knipt het bestand in losse pagina's, laat er OCR overheen lopen, en plakt de tekst daarna weer aan elkaar. Meestal gaat dat goed — tot er een tabel over twee pagina's doorloopt. Dan staan de kolomkoppen op pagina 3 en de rijen op pagina 4, en klopt er niets meer van.
Sinds 22 juni 2026 staat Unlimited-OCR van Baidu online. De modelkaart beschrijft verwerking van tientallen pagina's in één forward pass binnen 32.768 tokens. Het model staat onder MIT-licentie op Hugging Face.
Wat er anders is aan dit model
Unlimited-OCR is geen klassieke tekstherkenner die letters uit pixels vist. Het is een vision-language-model: je geeft het de afbeelding van een pagina, en het geeft gestructureerde tekst terug — inclusief tabellen en de juiste leesvolgorde. Het verschil zit in het geheugen: met een contextvenster van 32.768 tokens kan het model meerdere pagina's tegelijk overzien, in plaats van elke pagina als een losse puzzel te behandelen.
Dat kan samenhang over meerdere pagina's beter beschikbaar houden dan een pipeline die elke pagina volledig los behandelt. De grens blijft het contextvenster; "Unlimited" betekent dus niet dat ieder document ongeacht lengte in één keer past.
De feiten op een rij
Wat er controleerbaar in de officiële modelkaart staat:
- Model:
baidu/Unlimited-OCRop Hugging Face - Licentie: MIT — vrij te gebruiken, ook commercieel
- Omvang: 3 miljard parameters
- Contextvenster: 32.768 tokens
- Uitgebracht: 22 juni 2026, met de paper Unlimited OCR Works op arXiv
- Draaien via: Transformers, vLLM, SGLang of Docker
De officiële modelkaart publiceert de hierboven genoemde model-, licentie-, context- en uitvoeringsgegevens. Test nauwkeurigheid altijd op je eigen documentsoorten.
Waarom dit interessant is als je met documenten werkt
De modelkaart bevat een voorbeeldpipeline: pagina's worden afbeeldingen en gaan als lijst naar de multi-page-functie, die gestructureerde tekst kan teruggeven. Test de pipeline op je eigen documenttypen; integratie-, validatie- en foutafhandelingslogica blijft nodig.
Bij facturen, jaarrekeningen, contracten en dossiers moet je apart controleren of tabellen, leesvolgorde en paginagrenzen correct zijn overgenomen.
Wanneer lokale uitvoering gegevens op eigen hardware houdt
Bij een externe OCR-dienst upload je documenten naar de gekozen aanbieder en gelden diens prijs- en privacyvoorwaarden. Bij een volledig lokaal geconfigureerde installatie kan de inhoud op eigen hardware blijven. Controleer ook dan dependencies, logging, updates en netwerkverkeer.
Alleen bij een volledig lokaal geconfigureerde route zonder externe logging, downloads tijdens verwerking of andere netwerkafhankelijkheden blijft de documentinhoud op eigen hardware. Controleer dat technisch en contractueel voordat je gevoelige documenten verwerkt.
Wat er tegenover staat
"Draait lokaal op je eigen machine" klinkt aantrekkelijker dan het is. De officiële instructies gaan uit van een NVIDIA-videokaart met CUDA. Op een doorsnee laptop zonder losse videokaart ga je dit model niet even draaien. Lokaal betekent hier "op jouw hardware", niet "even op je laptop in de trein".
Vergelijk daarom de werkelijke hardware-, energie- en beheerkosten met de actuele prijs van een externe dienst. Zonder eigen volume-, hardware- en personeelsgegevens is geen algemeen break-evenpunt te geven.
Wat je vandaag kunt doen
Wil je weten of het iets voor jou is, test het dan niet op je mooiste document maar op je lelijkste. Pak dat ene rapport met een tabel die over de paginarand doorloopt, of die scan die net iets scheef ligt. Daar zit de hele belofte in: blijft die tabel heel, dan heb je iets waardevols te pakken.
En blijft het bij losse PDF's die je wilt combineren voordat je ze archiveert of doorstuurt? Dat kan direct hierboven zonder account. De applicatie draait bij Netcup in Duitsland; tijdelijke opslag loopt via Cloudflare.
Probeer het nu
PDF's samenvoegen — direct, zonder account
Gratis tot 5 bestanden per merge. App bij Netcup in Duitsland; tijdelijke opslag via Cloudflare. Binnen 1 uur gewist.
Begin met samenvoegen