Expertos cuestionan que Moonshot copiara Anthropic Fable para crear Kimi K3
Expertos en inteligencia artificial dudan de que el modelo Kimi K3 de Moonshot se haya desarrollado principalmente mediante distilación del modelo Fable de Anthropic, dado el corto tiempo disponible desde la liberación del modelo estadounidense.
El asesor científico de la Casa Blanca, Michael Kratsios, afirmó que Moonshot, la empresa china detrás de Kimi K3 (el modelo de lenguaje de código abierto más grande disponible), construyó su modelo copiando el modelo Fable de Anthropic mientras utilizaba chips que no están autorizados para exportación a China.
"La destilación industrial a gran escala y encubierta destinada a robar tecnología patentada estadounidense y socavar la investigación estadounidense es inaceptable", escribió Kratsios, en medio de discusiones reportadas sobre prohibir modelos de código abierto chinos que han agitado el sector de la inteligencia artificial. Moonshot no respondió a preguntas sobre su proceso de entrenamiento, y Kratsios no compartió más detalles sobre las fuentes de sus acusaciones.
Las declaraciones de Kratsios hicieron eco de los comentarios del Secretario del Tesoro Scott Bessent de que "estamos encontrando marcas de agua de nuestros modelos de lenguaje grandes estadounidenses en muchos de los modelos chinos, y eso es inaceptable". No está claro en qué consisten esas marcas de agua, y el Departamento del Tesoro no respondió a una consulta.
Escepticismo de los expertos
Sin embargo, los expertos son escépticos de que la destilación (el proceso de interrogar un modelo de lenguaje para determinar su funcionamiento interno y copiar sus capacidades) sea responsable de las capacidades avanzadas que muestra Kimi K3.
"No creo que obtengas un modelo de esta fortaleza y tan rápidamente en los talones de Fable haciendo estrictamente destilación", dijo Braden Hancock, investigador en el Instituto Laude y cofundador de Snorkel AI, a TechCrunch. "Simplemente no hay tiempo, ¿verdad? Fable solo ha estado disponible públicamente desde el 1 de julio. No puedes destilar esa cantidad de datos, entrenar un modelo y lanzarlo en dos semanas".
"He sido de la opinión de que la destilación se está volviendo menos impactante con el tiempo a medida que los modelos chinos se acercan a la frontera y el régimen de entrenamiento se cambia a aprendizaje por refuerzo", dijo Nathan Lambert, investigador de inteligencia artificial en el Allen Institute for AI, en un podcast lanzado ayer. "Si fuera el caso, todos podrían fácilmente ponerse al día con un GLM o con un K3 usando sus datos para destilación. Pero no hemos visto, o no veremos esto, solo de ajuste fino supervisado".
La destilación requiere que un laboratorio interrogue sistemáticamente su modelo objetivo para generar datos que puedan usarse para post-entrenamiento, lo que consume meses de tiempo de cómputo de GPU.
Fuente: TechCrunch
