La inteligencia artificial generativa de vídeo acaba de recibir una actualización que promete cambiar radicalmente cómo se crea contenido audiovisual: Kling AI ha activado la función de Control de Voz en su nueva versión Kling VIDEO 2.6. Esta característica no solo amplía las capacidades del modelo, sino que ofrece a los creadores una forma más natural y fluida de interactuar con la IA durante la producción de vídeos con audio integrado.
Con el lanzamiento de Kling VIDEO 2.6 por parte de la compañía china Kuaishou, la plataforma ha dado un paso más allá de la generación visual tradicional. Ahora, los usuarios pueden generar videos con voz, música, efectos de sonido y ambiente directamente en una sola pasada, lo que elimina la necesidad de herramientas de postproducción externas. Pero lo que realmente destaca en esta actualización es el Control de Voz, que permite dar instrucciones mediante comandos hablados para ajustar escenas, diálogos y parámetros sin escribir una sola palabra.
Para entender la relevancia de esta característica, hay que considerar cómo estaba estructurado el flujo de trabajo en herramientas de video generativo hasta ahora. En la mayoría de los casos, los creadores generaban primero imágenes o clips y luego añadían el audio en otro software, un proceso que era laborioso y rompía la inmersión creativa. Con Kling VIDEO 2.6, este patrón cambia: audio y vídeo se producen en sincronía desde el mismo prompt, y la función de voz brinda aún más comodidad al permitir que el usuario “hable” sus deseos al sistema.
El Control de Voz de Kling VIDEO 2.6 está diseñado para facilitar el proceso de creación de contenido audiovisual. Por ejemplo:
- Iniciar o pausar generadores mediante comandos de voz.
- Modificar diálogos directamente en la narración sin escribir texto.
- Ajustar parámetros de escena como duración, estilo de audio o ambiente solo con la voz.
- Iterar más rápido, agilizando el flujo de trabajo creativo.
Esta forma de interacción puede resultar especialmente útil para creadores de redes sociales, educadores y narradores digitales que necesitan rapidez y naturalidad sin sacrificar calidad.
La base técnica de Kling VIDEO 2.6 es una co-generación audiovisual en una sola ejecución. En lugar de generar un video silencioso y luego importar audio, el modelo crea el contenido visual y las pistas de voz, efectos y música de fondo al mismo tiempo. Esto posibilita una sincronización precisa de labios y ritmo visual, lo que da como resultado clips mucho más realistas y coherentes que los métodos tradicionales de edición.
Además, Kling VIDEO 2.6 admite múltiples idiomas nativos para la voz —incluyendo inglés y chino desde el lanzamiento— con control sobre la prosodia, entonación y estilo narrativo. Esto permite personalizar no solo el contenido visual sino también la forma en que se expresa —ya sea con tono dramático, informativo o narrativo— sin tener que recurrir a soluciones de texto a voz separadas.
La integración del Control de Voz y la generación de audio nativo en Kling VIDEO 2.6 representa una evolución significativa en las herramientas de IA para vídeo. Los creadores ya no están atados a procesos manuales de edición y pueden producir contenido audiovisual completo desde una sola interfaz multimodal. Esto no solo ahorra tiempo, sino que también potencia la creatividad y accesibilidad, permitiendo que incluso quienes no tienen experiencia técnica puedan generar vídeos de calidad profesional.
Además, esta actualización coloca a Kling AI en una posición mucho más competitiva frente a otros generadores de video con IA que han empezado a incorporar audio, como los modelos de Google o Runway, aunque ninguno —hasta la fecha— combina control por voz con audio nativo sincronizado en el mismo nivel de flujo de trabajo.
En resumen, Kling VIDEO 2.6 no solo redefine cómo se genera audiovisual con IA, sino también cómo los usuarios interactúan con estas herramientas, abriendo la puerta a una nueva era de contenido generativo accesible, fluido y profundamente intuitivo.





