El modelo de video IA de Avataar es más barato, rápido y culturalmente consciente, construido para la escala de India
La startup respaldada por Peak XV ha lanzado Varya, un modelo de generación de video construido para entender el contexto local de India, generando clips 10 veces más rápido y a una fracción del costo de alternativas globales.
La producción de modelos de IA de India ha sido lenta en comparación con Estados Unidos, Europa y China. Solo pocas startups están lanzando modelos, y la mayoría de ellos son modelos de lenguaje grande o modelos de voz. Para fomentar más desarrollo, el gobierno lanzó la Misión de IA India, una iniciativa de aproximadamente 1.200 millones de dólares que, entre otras cosas, otorga a startups seleccionadas acceso a computación GPU subsidiada a cambio de liberar sus modelos públicamente. Una de las 12 startups seleccionadas para el programa, Avataar AI, ha lanzado un nuevo modelo de video llamado Varya que está construido para entender el contexto local, como identificar diferentes festivales, alimentos y ropa.
La startup respaldada por Peak XV, que se enfoca en crear herramientas de video para el comercio electrónico, no construyó Varya desde cero. Comenzó con Wan 2.2, un modelo de generación de video disponible públicamente lanzado por Alibaba, y utilizó una técnica llamada destilación, esencialmente comprimiendo las capacidades del modelo en una versión más delgada y rápida optimizada para los casos de uso específicos de Avataar. El resultado es un modelo que se ejecuta en cuatro pasos en lugar de los 50 de Wan 2.2, produciendo video 10 veces más rápido y a una fracción del costo.
Para ponerlo en términos concretos: utilizando una GPU NVIDIA H200, Varya puede generar un clip de 720p de 5 segundos en 45 segundos, comparado con 1.230 segundos para Wan 2.2.
El aspecto más llamativo de Varya puede ser su precio. La empresa planea cobrar ₹0,48 (0,005 dólares) por segundo de video en su servicio alojado, mucho más barato que modelos como Veo, Kling, Luma y Runway, que típicamente cobran 0,10 dólares o más por segundo. Esa es aproximadamente una diferencia de precio de 20 veces.
"India es un mercado primero de video. Vemos esto en cada gran producto de internet de consumo en India: el video gana sobre el texto. Los modelos de video de IA actuales son demasiado caros para el uso a escala de población en India. Si la IA de video va a llegar a estudiantes, maestros, MIPYMES, creadores, empresas y servicios públicos, los costos tienen que bajar drásticamente. El costo es el mayor desbloqueador para la adopción de IA en India," dijo a TechCrunch Rajan Anandan, director gerente de Peak XV.
Los modelos de generación de imagen y video a menudo pierden matices culturales y producen salidas estereotipadas o genéricas, un problema que TechCrunch ha reportado antes. Avataar AI dice que entrenó a Varya en datos específicos de India para producir contenido más relevante localmente y evitar estos problemas.
Fuente: TechCrunch
