| Versión | 1.0 |
|---|---|
| Editor | Luigi Rosa |
| Fecha de lanzamiento | 19 nov 2012 |
| Fecha Agregada | 19 nov 2012 |
| Requisitos del sistema operativo | Windows 2003, Windows Vista, Windows 98, Windows Me, Windows, Windows NT, Windows 2000, Windows 8, Windows Server 2008, Windows 7, Windows XP |
| Requisitos | Matlab |
| Descargas totales | 691 |
| Descargas por semana | 1 |
| Precio | Free |
Descripción
El reconocimiento óptico de caracteres (OCR) es la traducción de mapas de bits escaneados ópticamente de caracteres de texto impresos o escritos en códigos de caracteres, como ASCII. Esta es una forma eficiente de convertir materiales impresos en archivos de datos que se pueden editar y manipular en una computadora. Esta es la tecnología utilizada durante mucho tiempo por las bibliotecas y las agencias gubernamentales para hacer que los documentos extensos estén rápidamente disponibles electrónicamente. Los avances en la tecnología OCR han estimulado su uso cada vez mayor por parte de las empresas. Para muchas tareas de entrada de documentos, OCR es el método disponible más rentable y rápido. Y cada año, la tecnología libera acres de espacio de almacenamiento que antes se dedicaban a archivadores y cajas llenas de documentos en papel. Antes de que se pueda usar OCR, el material de origen debe escanearse con un escáner óptico (y, a veces, una placa de circuito especializada en la PC) para leer la página como un mapa de bits (un patrón de puntos). También se requiere software para reconocer las imágenes.
Nuestro paquete de software propone resolver la clasificación de caracteres manuscritos aislados y dígitos del Conjunto de Datos de Caracteres de Pluma UJI utilizando Redes Neuronales. Los datos consisten en muestras de 26 caracteres y 10 dígitos escritos por 11 escritores en una tableta. Los caracteres (en formato UNIPEN estándar) se escriben tanto en mayúsculas como en minúsculas y hay un conjunto completo de dos caracteres por escritor. Entonces la salida debe estar en una de las 35 clases. El objetivo final es construir un modelo independiente de escritor para cada personaje.
La selección de características valiosas es crucial en el reconocimiento de caracteres, por lo que se adopta un nuevo y significativo conjunto de características, las Coordenadas normalizadas diferenciales uniformes (UDNC), presentadas por C. Agell. Se muestra que estas características mejoran la tasa de reconocimiento utilizando algoritmos de clasificación simples, por lo que se utilizan para entrenar una red neuronal y probar su rendimiento en el conjunto de datos de caracteres de lápiz UJI.
Términos del índice: Matlab, fuente, código, ocr, reconocimiento óptico de caracteres, texto escaneado, texto escrito, ascii, carácter aislado.