Tu recepcionista IA en vivo en 3 minutos. Gana 11k créditos gratis →

¿Qué es DeepSeek-OCR 2?

Escrito porYaqi
Última actualización: June 24, 2026Verificado por expertos

El 27 de enero de 2026, DeepSeek lanzó DeepSeek-OCR 2 en HuggingFace y GitHub, acompañado de un completo artículo de investigación.

Este nuevo modelo representa un gran avance en el procesamiento de documentos, al introducir Visual Causal Flow: una tecnología que permite al modelo reordenar dinámicamente los tokens visuales según el contenido, en lugar de seguir un patrón de escaneo fijo. A diferencia del DeepSeek-OCR original, que se centraba en la compresión visual, OCR 2 adopta un enfoque distinto al permitir que el modelo entienda y procese documentos de una forma más parecida a como lo hacen los humanos.

El lanzamiento ha atraído una atención significativa, ya que demuestra mejoras sustanciales en precisión, comprensión del orden de lectura y fiabilidad en producción.

1. Qué es OCR: definición y limitaciones tradicionales

La tecnología de reconocimiento óptico de caracteres (OCR) convierte imágenes de texto en texto legible por máquina. Los sistemas OCR tradicionales y los primeros modelos de visión-lenguaje (VLM) dependen de un procesamiento de escaneo raster fijo, leyendo las imágenes de izquierda a derecha y de arriba abajo, lo que contradice la forma en que los humanos perciben naturalmente la información visual. Este enfoque mecánico ha sido el estándar durante décadas, pero está fundamentalmente desalineado con la comprensión semántica.

El orden rígido de escaneo raster crea problemas importantes al procesar diseños de documentos complejos. Cuando un VLM encuentra una tabla con varias columnas, procesa la fila de encabezado, luego salta a la columna 2 fila 1, después a la columna 2 fila 2, antes de volver finalmente a las filas de la columna 1, creando secuencias de tokens ilógicas. De forma similar, el texto en varias columnas, las fórmulas intercaladas con texto explicativo y los tipos de contenido mixtos se leen en secuencias poco naturales, lo que hace que el modelo malinterprete las relaciones entre la información.

Esto conduce a tres fallos críticos: menor precisión en documentos complejos, interpretación incorrecta del orden de lectura (donde la información relacionada queda dispersa a lo largo de la secuencia) y mayores tasas de error en entornos de producción, incluida la duplicación de texto y las alucinaciones. El problema fundamental es que los VLM tradicionales no entienden el flujo semántico de la información; simplemente siguen un patrón de escaneo mecánico.

2. Soluciones de DeepSeek-OCR 2

Visual Causal Flow: la innovación central

flujo causal visual

DeepSeek-OCR 2 introduce un concepto revolucionario llamado Visual Causal Flow, que otorga al modelo la capacidad de reordenar dinámicamente los tokens visuales según el contenido de la imagen y las relaciones semánticas. En lugar de adherirse a un patrón fijo de escaneo raster, el modelo ahora entiende el flujo lógico de la información dentro de un documento y reorganiza los tokens visuales para que coincidan con esa secuencia lógica. Esto es fundamentalmente distinto de los enfoques anteriores: no se trata solo de una mejor compresión o de una extracción de características más inteligente, sino de una reinterpretación completa de cómo debe secuenciarse la información visual para los modelos de lenguaje.

La idea clave es que la comprensión visual debe ser causal: el modelo debe razonar sobre qué elementos visuales preceden lógicamente a otros, de forma similar a como los humanos siguen el flujo de información en un documento complejo. Al leer una tabla, los humanos no escanean mecánicamente de izquierda a derecha; entienden que la fila de encabezado aporta contexto y luego leen los datos de cada columna en orden. DeepSeek-OCR 2 replica este proceso de razonamiento.

DeepEncoder V2 impulsa Visual Causal Flow mediante cuatro innovaciones clave:

Innovación 1: base LLM compacta

El DeepEncoder original usaba CLIP como base de codificación visual. DeepSeek-OCR 2 sustituye CLIP por Qwen2-0.5B, una arquitectura LLM compacta. Esto permite que el codificador aproveche capacidades de comprensión del lenguaje y razone semánticamente sobre el contenido visual. Usar un modelo de lenguaje como codificador visual permite entender las relaciones semánticas entre elementos visuales, no solo las características visuales. Qwen2-0.5B equilibra la capacidad de comprensión semántica con la eficiencia computacional.

Innovación 2: mecanismo de atención híbrida

La arquitectura utiliza atención de doble componente. Los tokens visuales usan atención bidireccional (estilo ViT), lo que permite que cada token atienda a todos los demás sin restricciones direccionales. Esto captura el contexto completo de la imagen y las relaciones distantes. Al mismo tiempo, los tokens de consulta aprendibles gestionan consultas de flujo causal, atendiendo a todos los tokens visuales y a las consultas anteriores para realizar el reordenamiento lógico. La atención bidireccional gestiona la comprensión del contexto, mientras que la atención causal gestiona la secuenciación lógica.

Innovación 3: razonamiento causal en cascada

La estructura en cascada de dos niveles cambia cómo fluye la información visual. El codificador utiliza tokens de consulta para realizar el reordenamiento semántico, creando una secuencia ordenada que respeta el flujo de contenido del documento. Luego, el decodificador LLM procesa esta secuencia ordenada de forma inteligente. Ambas etapas funcionan en armonía: el decodificador se centra en comprender el contenido en lugar de determinar el orden de lectura, lo que mejora la eficiencia y la precisión.

Innovación 4: compresión inteligente de tokens

Los tokens visuales se controlan en el rango de 256-1,120 según la complejidad de la imagen. Esto mantiene una alta compresión sin salirse de los presupuestos de tokens de modelos como Gemini 3 Pro. La compresión no sacrifica calidad porque los tokens se reordenan de forma inteligente y se priorizan semánticamente. Los encabezados de tabla reciben más tokens que los elementos decorativos; las regiones con mucho texto reciben más tokens que los espacios en blanco.

Mejoras de rendimiento

Las innovaciones ofrecen mejoras medibles: 91.09% de precisión en OmniDocBench v1.5 (+3.73% frente al original), distancia de edición del orden de lectura reducida de 0.085 a 0.057 (32.9% de mejora), tasa de duplicación en producción reducida de 6.25% a 4.17% (33.3% de reducción) y un máximo de 1,120 tokens visuales, lo que permite una inferencia más rápida y una mejor escalabilidad.

3. Influencia y tendencias futuras

Impacto actual y aplicaciones en la industria

DeepSeek-OCR 2 establece un nuevo estándar para la comprensión de documentos en múltiples sectores. Las instituciones financieras ahora pueden procesar estados financieros, facturas y contratos complejos con una precisión significativamente mayor. Los despachos jurídicos pueden extraer información de documentos de varias páginas conservando correctamente el orden de lectura. Las instituciones académicas pueden analizar artículos de investigación con mejor reconocimiento de fórmulas y figuras. Las empresas de comercio electrónico pueden extraer información de productos de diversos formatos de documentos con mayor fiabilidad.

El lanzamiento de código abierto democratiza el acceso a tecnología OCR de vanguardia, lo que permite a startups y organizaciones más pequeñas crear flujos sofisticados de procesamiento de documentos sin inversiones masivas en I+D. Esto tiene implicaciones significativas para las iniciativas de transformación digital a escala global.

Direcciones futuras e implicaciones para la investigación

DeepSeek ha esbozado planes ambiciosos para el desarrollo futuro. El equipo pretende explorar la implementación de una verdadera comprensión y razonamiento de imágenes 2D mediante un enfoque en cascada que utiliza dos razonadores causales 1D. Esta evolución mejoraría aún más la capacidad del modelo para entender relaciones espaciales y diseños visuales complejos que requieren razonamiento horizontal y vertical simultáneo.

Más allá de OCR, el concepto de Visual Causal Flow tiene implicaciones más amplias para los modelos de visión-lenguaje. El principio de reordenar dinámicamente los tokens visuales según el contenido semántico podría aplicarse a otras tareas de VLM, con el potencial de mejorar el rendimiento en comprensión de documentos, respuesta a preguntas visuales y generación de descripciones de imágenes. Esto representa un cambio de paradigma en cómo los VLM deben procesar la información visual: pasar de patrones de escaneo fijos a una secuenciación inteligente y consciente del contenido.

Tendencias emergentes en Document AI

Es probable que el éxito de Visual Causal Flow inspire enfoques similares en la comunidad de IA en general. Podemos esperar ver más investigación sobre ordenación de tokens consciente de la semántica, comprensión jerárquica de documentos y procesamiento visual consciente del contexto. La combinación de modelos de lenguaje con comprensión visual se está volviendo cada vez más sofisticada, y DeepSeek-OCR 2 demuestra que la innovación arquitectónica en la secuenciación de tokens puede generar mejoras significativas de rendimiento.

Tu recepcionista IA, en vivo en minutos.

Escala tu recepción con una IA que nunca duerme. Solvea atiende consultas ilimitadas en múltiples canales, agenda citas automáticamente en tu calendario y evita oportunidades perdidas las 24 horas.

4. Conclusión

DeepSeek-OCR 2 representa un cambio de paradigma fundamental en cómo las máquinas entienden la información visual. Al introducir Visual Causal Flow y la innovadora arquitectura DeepEncoder V2, el modelo aborda limitaciones centrales de los enfoques tradicionales que han persistido durante décadas. La combinación de precisión superior (91.09%), mejor comprensión del orden de lectura (32.9% mejor), mayor fiabilidad en producción (33.3% menos duplicaciones) y eficiencia excepcional (1,120 tokens máximos) lo convierte en una solución transformadora para el procesamiento de documentos.

Las innovaciones arquitectónicas —base LLM compacta, mecanismo de atención híbrida, razonamiento en cascada y compresión inteligente— trabajan juntas para permitir que el modelo procese documentos como lo hacen los humanos: entendiendo el flujo semántico en lugar de seguir patrones de escaneo mecánicos. Con disponibilidad de código abierto en HuggingFace y GitHub, estos avances son accesibles de inmediato para la comunidad global. DeepSeek-OCR 2 no es solo una mejora incremental respecto a los sistemas OCR anteriores; representa una nueva era en la comprensión de documentos, en la que las máquinas pueden razonar sobre la información visual con una conciencia semántica similar a la humana.

Recepcionista IA

La forma más sencilla de no perder ningún cliente: teléfono, email, SMS o chat

TeléfonoEmailSMSChat en vivo

Solvea responde cada conversación en todos los canales. Se configura en minutos, sin código y con plantillas incluidas.

  • Funciona 24/7 sin descansos ni horas extra
  • Configuración sin código con plantillas listas para usar
  • Se conecta con las herramientas que ya usas
  • Omnicanal: un agente para cada punto de contacto
Descargar app iOSProbar en PC

No se requiere tarjeta