Em 20 de outubro de 2025, a FinePdfs anunciou código-fonte, conjuntos de dados rotulados e um classificador voltados a fluxos de OCR para PDFs.
Publicado em 20 de outubro de 2025, o anúncio da FinePdfs descreve a publicação do código-fonte completo do OCR-Annotations, de um conjunto com 1,6 mil PDFs rotulados e do Gemma-LID-Annotation, com 20 mil amostras por idioma. Também inclui o XGB-OCR, um classificador de OCR para PDFs.
Segundo o anúncio, os conjuntos de dados e o classificador podem ajudar engenheiros a criar ou avaliar fluxos de OCR para PDFs. Para conferir os detalhes e verificar o material original, consulte a publicação da FinePdfs e examine os repositórios, os dados e o código citados; não presuma resultados além dos informados. Se usar IA para estudar ou aplicar esses recursos, evite enviar documentos com dados pessoais sem necessidade e confira a política da organização.