Ejecutando Kimi K3 en MI355X con mejor rendimiento por dólar que B300
Un informe de benchmark de wafer.ai que afirma que el modelo Kimi K3 funciona de forma más rentable en las GPU MI355X de AMD que en las B300 de Nvidia recibe un escrutinio intenso por métodos opacos, configuraciones irreproducibles y precios de alquiler en la nube elegidos selectivamente. Los comentaristas sostienen que las tablas de rendimiento en realidad muestran a las B300 ganando en rendimiento bruto, ponen en duda la realidad de las tarifas horarias de GPU citadas y del costo total de propiedad, y ven la publicación más como marketing que como ingeniería rigurosa. Un gran debate derivado gira en torno a si publicar solo los pesos del modelo califica como “código abierto”, destacando tensiones no resueltas sobre cómo se aplican los conceptos tradicionales de libertad del software a los modelos modernos de IA.
Preocupaciones sobre la calidad del artículo y el “AI slop”
- Varios comentaristas describen la publicación como “slop” o escrita con pereza, aunque algunos señalan que es más legible que el contenido típico generado por IA.
- Una persona usó un modelo avanzado para criticar el artículo y sintió que exponía fallas graves; otros argumentan que, dado el prompt tan duro, cualquier artículo habría sido destrozado.
- Entre las quejas concretas están una mala edición, una sección de prefill poco clara y un diseño visual débil (por ejemplo, mal contraste entre texto y fondo).
Metodología y corrección de los benchmarks
- Varios comentaristas cuestionan si la configuración de Kimi K3 sigue siendo coherente después de optimizaciones de bajo nivel (por ejemplo, padding en el recuento de cabezas) y preguntan si se ejecutaron benchmarks de corrección.
- Un representante de wafer afirma que para alojarlo en OpenRouter se requieren benchmarks como tau/gpqa y pruebas de coherencia/pensamiento.
- Algunos critican el uso de un contexto de entrada corto de 1024 tokens por considerarlo anticuado y poco representativo.
- Otros señalan que las cifras de B200 están penalizadas por el all-reduce entre nodos sobre RoCE, con detalles ausentes sobre interconexiones mejores como Infiniband.
Rendimiento por dólar e hipótesis de precios
- Muchos cuestionan los precios por hora de GPU que se afirman, en especial el marco de $2.50/hr para MI355X frente a $6/hr para B300.
- Los críticos dicen que el precio de MI355X está escogido selectivamente de un agregador concreto, puede no reflejar capacidad real y confiablemente disponible, e ignora el TCO de propiedad, la energía y los descuentos.
- Algunos señalan que los precios spot/on-demand, la escasez y los descuentos por compromiso hacen que gran parte del “discurso sobre precios de GPU” sea poco fiable.
- Hay escepticismo sobre que los alquileres de MI355X a esas tarifas puedan cubrir el capex de hardware durante vidas útiles realistas.
Posicionamiento y reputación de wafer
- Varios acusan al texto de ser, en la práctica, un anuncio de AMD/wafer con comparaciones exageradas o injustas y benchmarks irreproducibles.
- Se citan problemas pasados, como un producto de suscripción por tokens abandonado rápidamente, como evidencia de un comportamiento impulsado por el hype.
- Otros argumentan que, aunque sea promocional, optimizar la economía de inferencia es socialmente importante dado el gran gasto en el serving de LLM.
Modelos de “código abierto” vs “pesos abiertos”
- Largo debate sobre si publicar solo los pesos califica como “código abierto”.
- Un lado: los pesos son el “source” para modificar el modelo; licencias abiertas sobre pesos + código satisfacen criterios similares a la libertad del software.
- El otro lado: los datos y el proceso de entrenamiento son el verdadero “source”; los pesos son análogos a binarios, así que “pesos abiertos” es el término honesto.
- Algunos distinguen entre “ciencia abierta” (reproducibilidad completa, incluidos datos y proceso) y simplemente pesos abiertos.