Meta ha dado un nuevo paso en la evolución de la edición multimedia con el lanzamiento de SAM Audio, una extensión de su conocido proyecto Segment Anything que ahora se aplica al sonido. Esta nueva tecnología de inteligencia artificial permite aislar, extraer o separar sonidos específicos de un vídeo o archivo de audio de forma intuitiva, utilizando un simple clic, una indicación temporal o una instrucción escrita en lenguaje natural.
Hasta ahora, Segment Anything se había consolidado como una herramienta clave para segmentar objetos en imágenes y vídeo. Con SAM Audio, Meta traslada ese mismo enfoque al dominio sonoro, un área tradicionalmente compleja que suele requerir software especializado y conocimientos técnicos avanzados. El objetivo es claro: hacer que la edición de audio sea más accesible, rápida y flexible para creadores y profesionales.
Una de las principales novedades de SAM Audio es su sistema de interacción multimodal. Los usuarios pueden escribir qué sonido desean aislar, como “voz humana”, “ruido de fondo” o “música”, y el modelo se encarga de localizarlo y separarlo del resto del audio. También es posible hacer clic sobre un objeto visible en el vídeo, como una guitarra o un coche, para que el sistema identifique el sonido asociado a ese elemento. Además, se pueden usar marcadores temporales para indicar en qué momento debe centrarse la segmentación.
Meta describe este modelo como unificado, lo que significa que no está diseñado para una única tarea concreta, sino que puede adaptarse a distintos escenarios de edición. A diferencia de otras soluciones que requieren modelos diferentes para cada tipo de sonido, SAM Audio funciona como una base general capaz de responder a múltiples tipos de instrucciones. Esta flexibilidad abre la puerta a usos muy diversos, desde la limpieza de diálogos hasta la creación de mezclas más complejas.
En el ámbito profesional, la tecnología puede resultar especialmente útil para editores de vídeo, podcasters, cineastas y músicos, que a menudo necesitan separar pistas de audio en grabaciones donde todo está mezclado en un solo canal. También tiene potencial en contextos educativos y de accesibilidad, permitiendo destacar o eliminar sonidos específicos para mejorar la comprensión del contenido.
Otro aspecto relevante es la integración del audio con la información visual. Al combinar lo que ocurre en la imagen con lo que se escucha, el sistema puede comprender mejor el origen de los sonidos, lo que mejora la precisión de la segmentación. Este enfoque multimodal refuerza la apuesta de Meta por modelos de IA capaces de entender el mundo de forma más parecida a los humanos, utilizando múltiples fuentes de información al mismo tiempo.
Meta ha puesto SAM Audio a disposición de la comunidad investigadora y creativa a través de su plataforma de pruebas, con la intención de recopilar feedback y explorar nuevos casos de uso. La compañía también ha destacado que este avance forma parte de su visión a largo plazo para desarrollar herramientas de creación más potentes basadas en inteligencia artificial.
Con este lanzamiento, Meta amplía el alcance de Segment Anything y demuestra cómo los mismos principios que revolucionaron la edición visual pueden aplicarse ahora al sonido. La edición de audio asistida por IA da así un paso hacia procesos más intuitivos, donde describir lo que se quiere hacer resulta tan importante como saber usar una herramienta técnica.





