Expertos desmienten que Kimi K3 haya sido creado por destilación de modelo Fable de Anthropic
Investigadores señalan que es técnicamente imposible que el modelo chino Kimi K3 haya sido desarrollado únicamente mediante destilación del modelo Fable de Anthropic, dado el tiempo transcurrido.
El asesor científico de la Casa Blanca, Michael Kratsios, afirmó que Moonshot, la empresa china detrás de Kimi K3, el modelo de lenguaje de código abierto más grande disponible, construyó su modelo copiando el modelo Fable de Anthropic mientras utilizaba chips que no están autorizados para exportar a China.
"La destilación industrial a gran escala y encubierta dirigida a robar tecnología propietaria estadounidense y socavar la investigación estadounidense es inaceptable", escribió Kratsios, en medio de conversaciones reportadas sobre la prohibición de modelos de código abierto chinos que han generado revuelo en el sector de IA. Moonshot no respondió a las preguntas sobre su proceso de entrenamiento, y Kratsios no compartió más detalles sobre las fuentes de sus afirmaciones.
El tuit de Kratsios hizo eco de comentarios del secretario del Tesoro Scott Bessent que afirmó que "estamos encontrando marcas de agua de nuestros modelos de lenguaje estadounidenses en muchos de los modelos chinos, y eso es inaceptable". No está claro qué consisten esas marcas de agua, y el Departamento del Tesoro no respondió a una consulta.
Expertos escépticos sobre la destilación
Sin embargo, los expertos son escépticos de que la destilación (el proceso de consultar un modelo de lenguaje para determinar su funcionamiento interno y copiar sus capacidades) sea responsable de las capacidades avanzadas que Kimi K3 muestra.
"No creo que obtengas un modelo tan fuerte y tan rápidamente en las secuelas de Fable haciendo únicamente destilación", dijo Braden Hancock, investigador del Laude Institute y cofundador de Snorkel AI, a TechCrunch. "Simplemente no hay tiempo, ¿verdad? Fable solo ha estado disponible públicamente desde el 1 de julio. No puedes destilar esa cantidad de datos, entrenar un modelo y lanzarlo en dos semanas".
"He sido de la opinión de que la destilación se vuelve cada vez menos impactante a medida que los modelos chinos se acercan a la frontera y el régimen de entrenamiento cambia al aprendizaje por refuerzo", dijo Nathan Lambert, investigador de IA del Allen Institute for AI, en un podcast lanzado ayer. "Si fuera el caso, todos podrían fácilmente ponerse al día con un GLM o un K3 usando sus datos para destilación. Pero no hemos visto esto, o no lo veremos, solo con ajuste fino supervisado".
Proceso técnico y limitaciones
Realizar destilación requiere que un laboratorio consulte sistemáticamente su modelo objetivo para generar datos que puedan usarse para entrenamiento posterior. Este proceso es tiempo intensivo y hay limitaciones en cuánto mejora el modelo puede lograr a través de esta técnica sola.
Fuente: TechCrunch
