Kog profundiza para exprimir más inferencia de las GPUs
La startup francesa Kog apuesta a que hay mucho más poder que puede extraerse de las GPUs convencionales para acelerar la inferencia de modelos de IA, demostrando velocidades de 3.000 tokens por segundo en pruebas.
La carrera por una inferencia de IA más rápida está en marcha, y los mercados dieron una bienvenida cálida a Cerebras y sus chips de propósito específico en su debut de salida a bolsa en mayo. Pero la startup francesa Kog está apostando a que hay mucho más poder que puede extraerse de las GPUs convencionales.
La startup llegó a la primera página de Hacker News en mayo con una vista previa técnica destinada a demostrar que la decodificación de solicitud única extremadamente rápida es posible en las GPUs estándar de centro de datos que las empresas ya poseen, como las GPUs AMD MI300X y Nvidia H200 que utilizó para su demostración.
Potencial para casos de uso empresariales
Algunos quedaron decepcionados al escuchar que esto no se extendía a las GPUs en nuestras computadoras portátiles, pero otros vieron el potencial. Con la velocidad de inferencia y los costos siendo ahora un cuello de botella crítico, la promesa de Kog de desbloquear nuevas capacidades en hardware existente con optimización de software atrajo a más que solo observadores. Tuvimos 200 clientes comerciales tangibles, le dijo el CEO Gaël Delalleau a TechCrunch.
Basándose en retroalimentación temprana, el fundador en solitario espera que la ingeniería de software sea el primer caso de uso. Los usuarios veteranos de Claude Code están bien conscientes de que a veces tienen que esperar horas para obtener resultados. Anthropic mismo entiende que la velocidad vale dinero, y cobra un múltiplo de precio por modo rápido de Claude.
Desafío de escala para modelos grandes
Kog espera orientarse a los clientes rechazados por esos retrasos, generalmente porque dependen de flujos de trabajo de IA para tareas profesionales. Pero la startup también tiene socios de diseño que permiten a los usuarios generar juegos y aplicaciones con un prompt, y para quienes un resultado más rápido gracias al Motor de Inferencia Kog (KIE) significaría más ingresos, dijo Delalleau.
La empresa se da cuenta de que este mercado aún no está completamente maduro. Mientras observaba la demanda, Kog se enteró de que sus clientes potenciales no estaban preparados para ajustar modelos pequeños. Por eso desde el lanzamiento, hemos estado completamente enfocados en acelerar el desarrollo de modelos más grandes para satisfacer la demanda que hemos visto.
Objetivos ambiciosos de velocidad
Esto deja a Kog con un gran salto que hacer para entregar en su promesa de inferencia de LLM 30 veces más rápida. Su demostración mostró impresionantes 3.000 tokens por solicitud por segundo (TPS), pero con un modelo pequeño construido a propósito con solo alrededor de 2 mil millones de parámetros, el Laneformer 2B, ahora de código abierto.
Contradictiendo a los escépticos, Delalleau está confiado en que el mismo enfoque puede funcionar igual de bien con LLMs, cuyo tamaño puede ser un desafío para los chips de inferencia.
Fuente: TechCrunch
