El Allen Institute for AI (Ai2) ha dado un paso importante en el desarrollo de modelos multimodales con el lanzamiento de Molmo 2, una nueva familia de sistemas de inteligencia artificial de código abierto diseñada para llevar la comprensión avanzada de vídeo, el pointing espacial y el tracking de objetos a un nuevo nivel. Este anuncio ha captado rápidamente la atención de la comunidad de IA por combinar alto rendimiento, apertura total y capacidades prácticas que hasta ahora estaban reservadas, en muchos casos, a modelos propietarios.
Molmo 2 no es simplemente un modelo que “ve” vídeos. Su principal innovación está en la forma en que entiende lo que ocurre a lo largo del tiempo, permitiendo responder preguntas complejas sobre secuencias visuales, identificar eventos concretos, señalar ubicaciones exactas dentro de un fotograma y seguir objetos específicos a través de múltiples escenas. Estas habilidades son claves para aplicaciones reales como robótica, análisis de seguridad, asistentes visuales y herramientas de investigación científica.
Uno de los puntos más destacados de Molmo 2 es su enfoque nativamente multimodal. El modelo combina visión y lenguaje de forma profunda, lo que significa que no solo reconoce patrones visuales, sino que los conecta con descripciones en lenguaje natural. Por ejemplo, puede responder a preguntas como “¿en qué momento aparece el coche rojo?” o “¿qué objeto está siendo manipulado por la persona al final del vídeo?”, señalando incluso la región exacta donde ocurre la acción. Este nivel de precisión espacial y temporal es especialmente relevante para tareas de video understanding avanzado.
Ai2 ha lanzado Molmo 2 en varias versiones, incluyendo modelos de alrededor de 4B, 7B y 8B parámetros, lo que permite adaptar su uso tanto a entornos de investigación como a despliegues más eficientes. Además, el proyecto mantiene un compromiso claro con la apertura real, ofreciendo pesos, código y detalles técnicos que facilitan la reproducibilidad y la experimentación por parte de la comunidad.
En benchmarks recientes, Molmo 2 ha demostrado un rendimiento sobresaliente en tareas de seguimiento de objetos (tracking), razonamiento visual y comprensión de secuencias de vídeo, superando a otros modelos open source consolidados. En algunos escenarios concretos, incluso logra resultados comparables —y en ocasiones superiores— a modelos cerrados de grandes compañías tecnológicas, lo que refuerza la idea de que la IA abierta puede competir al más alto nivel.
Otro aspecto clave es su capacidad de pointing, es decir, la habilidad de señalar con precisión “dónde” ocurre algo dentro de una imagen o un vídeo. Esto resulta fundamental para sistemas interactivos, ya que permite una comunicación más natural entre humanos y máquinas. En lugar de respuestas vagas, Molmo 2 puede indicar áreas específicas del fotograma, facilitando la validación visual y la confianza en las respuestas del modelo.
El lanzamiento de Molmo 2 también refleja una tendencia más amplia en el sector: el creciente interés por modelos multimodales que vayan más allá del texto y puedan interpretar el mundo visual en movimiento. Con el auge del vídeo como formato dominante en internet y en entornos profesionales, herramientas capaces de analizarlo de forma inteligente se están convirtiendo en un componente estratégico para el futuro de la IA.
En definitiva, Molmo 2 posiciona a Ai2 como uno de los actores clave en la carrera por la comprensión de vídeo con inteligencia artificial abierta. Su combinación de capacidades avanzadas, transparencia y flexibilidad lo convierten en una referencia para investigadores, desarrolladores y empresas que buscan construir soluciones basadas en visión y lenguaje sin depender exclusivamente de plataformas cerradas.





