Describir las imágenes de un PDF
Escribe texto alternativo para las imágenes de un documento, dentro del documento, donde lo lee un lector de pantalla.
Qué hace esto
Un lector de pantalla que lee un PDF lee su árbol de estructura, no su página, así que una fotografía sobre la que no se dice nada es silencio, y un gráfico que carga con toda la idea de un informe es silencio con un pie de foto debajo. Esto escribe las descripciones dentro del propio archivo, en el elemento de cada imagen, de modo que el documento mejora en vez de que tú te lleves un texto. A quien ayuda no es a ti: es a quien le mandes el archivo, en una máquina que este producto no verá jamás.
Lo que no hará
Cada herramienta de aquí dice lo que no puede hacer, con sus propias palabras, antes de que confíes en ella.
- Es la única herramienta de IA que envía imágenes en vez de palabras. Las imágenes que van se te muestran antes de irse, como todo lo demás.
- Las descripciones se escriben dentro del archivo, en el elemento de la propia imagen. No se dibujan en la página.
- Un escaneo guardado como fax o JBIG2, y un JPEG 2000, no se pueden entregar a un proveedor y se informan en vez de enviarse.
- Una imagen dibujada desde dentro de un objeto de formulario —un sello, una cabecera repetida— solo se describe donde el documento ya está etiquetado para ella.
- El texto alternativo es una parte de un documento accesible. El orden de lectura, los encabezados, las cabeceras de tabla y el idioma del documento quedan intactos.
- Lo que dice la descripción es lo que vio un modelo. Léela antes de fiarte de ella, sobre todo en un gráfico en el que importan las cifras.
Preguntas que hace la gente
¿Dónde acaba la descripción?
Dentro del archivo, en el elemento de estructura al que pertenece la imagen: justo donde mira todo lector de pantalla hecho en los últimos veinte años. Viaja con el documento a todo el que lo abra.
¿Esto hace accesible mi documento?
Arregla una parte, y una parte importante. El orden de lectura, los encabezados, las cabeceras de tabla y el idioma del documento son cuestiones aparte que esto no toca.
¿Qué se envía exactamente al proveedor?
El texto que aparece en pantalla bajo «lo que se va a enviar», y nada más de tu documento. No es un resumen de la petición: es la petición. No sale nada hasta que pulsas enviar, y la página no puede enviarlo sin habértelo mostrado antes, porque el código se niega.
¿Cuánto cuesta esto?
Pagecraft no cobra nada y nunca lo hará. Tu proveedor te cobra por lo que le envías, a sus tarifas, en tu propia cuenta, y ves el recuento de tokens y una estimación en dólares antes de enviar nada. Un modelo en tu propia máquina no cuesta nada en absoluto.
¿Tengo que pagar por una clave de API?
No. Instala Ollama o LM Studio, corre un modelo en tu propio ordenador y apunta Pagecraft ahí: sin clave, sin factura, y tu documento no sale nunca del dispositivo. Ese camino aquí es de primera, no un apaño de segunda.