LFM2.5-VL-3B: Potencia de visión y lenguaje directamente en el dispositivo
Liquid AI presenta el LFM2.5-VL-3B, un modelo de visión y lenguaje de 3.1B de parámetros diseñado para funcionar localmente en dispositivos. Destaca por su velocidad, bajo consumo de memoria y capacidad para entender pantallas, documentos y realizar detección de objetos sin necesidad de servidores externos.
Puntos clave:
- Contexto: Redactado por Redacción Orbynex y validado por la mesa editorial.
- Hecho central:Liquid AI presenta el LFM2.5-VL-3B, un modelo de visión y lenguaje de 3.1B de parámetros diseñado para funcionar localmente en dispositivos. Destaca por su velocidad, bajo consumo de memoria y capacidad para entender pantallas, documentos y realizar detección de objetos sin necesidad de servidores externos.

El desarrollo de sistemas capaces de procesar simultáneamente texto e imagen ha dado un paso significativo hacia la autonomía del hardware local. Liquid AI ha presentado el LFM2.5-VL-3B, un modelo de lenguaje y visión diseñado específicamente para ejecutarse de forma eficiente en dispositivos finales, desde ordenadores portátiles hasta teléfonos móviles de última generación, sin depender de la conectividad constante a la nube.
Este nuevo modelo destaca por su capacidad para interpretar interfaces digitales y documentos complejos. A diferencia de otros sistemas que requieren procesos de razonamiento intermedio que ralentizan la respuesta, este desarrollo apuesta por respuestas directas. Esta característica es fundamental para aplicaciones en tiempo real donde la latencia es un factor crítico, permitiendo una interacción fluida en tareas de detección de objetos mediante lenguaje natural y la comprensión de múltiples imágenes de forma simultánea.
En términos técnicos, el LFM2.5-VL-3B utiliza un codificador de visión SigLIP2 de 400 millones de parámetros, integrado con una base de texto preentrenada. El entrenamiento ha sido exhaustivo, empleando 34 billones de tokens y cuadruplicando la cantidad de datos visuales respecto a versiones anteriores. Para garantizar su utilidad global, los desarrolladores han duplicado su vocabulario hasta los 128.000 términos, facilitando el soporte de escrituras no latinas sin necesidad de reiniciar el entrenamiento desde cero.
La eficiencia en el uso de recursos es uno de los pilares de este lanzamiento. El modelo ocupa aproximadamente 3 GB de memoria, lo que le permite alcanzar velocidades de procesamiento notables en hardware comercial. Por ejemplo, en procesadores móviles de alta gama, es capaz de generar hasta 20 tokens por segundo, mientras que en estaciones de trabajo con chips especializados, la cifra asciende a más de 200 tokens por segundo. Esta ligereza no compromete su versatilidad, ya que mantiene un rendimiento competitivo en pruebas de lógica matemática, comprensión de gráficos y ejecución de funciones.
La importancia de este avance radica en la democratización del procesamiento visual avanzado. Al permitir que tareas como el reconocimiento de texto (OCR) y la interpretación de interfaces de usuario se realicen localmente, se mejora la privacidad de los datos y se reducen los costes operativos para las empresas. El LFM2.5-VL-3B ya está disponible en plataformas de código abierto, facilitando su integración en diversos ecosistemas de inferencia y permitiendo que los desarrolladores adapten esta tecnología a necesidades específicas de productividad y automatización.