Mundara
← Volver a la galaxia

Las curvas suaves que convencieron a la industria de gastar miles de millones

Este paper transformó el entrenamiento de modelos de arte oscuro en algo parecido a ingeniería: pérdida predecible en función de datos, parámetros y cómputo, con leyes de potencia limpísimas. Es la justificación empírica de toda la carrera del escalado posterior. Léelo junto al de Chinchilla para ver cómo una corrección de detalle movió miles de millones de dólares.

Abrir el original ↗pdf0 visitas · 0 lectores

Jared Kaplan et al. · arXiv

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «Adam te aclara qué hacen momento y adaptación por parámetro; Scaling Laws te muestra cómo la pérdida cae con datos/ parámetros y cómputo. Juntos te permiten distinguir si al escalar el problema es optimización o falta de capacidad/datos y así asignar presupuesto eficazmente.»

    MIMarco Ibáñez
    Adam: el optimizador por defecto de media industria explicado por sus autoresPDF→
  • «Conectar A y B permite usar las leyes de scaling como marco diagnóstico: determinan si un salto emergente es efecto real o artefacto de medida y cuantifican el riesgo/inversión necesarios, mientras A recuerda los límites de previsibilidad que B pretende garantizar.»

    MIMarco Ibáñez
    Capacidades que aparecen de golpe al escalar: ¿fenómeno real o espejismo métrico?PDF→
  • «LoRA te enseña cómo personalizar modelos con mínimo impacto computacional; las leyes de escala te dicen qué tamaño de modelo y qué inversión en datos/cómputo maximizarán la ganancia de esa personalización. Juntas permiten decidir si conviene entrenar más o aplicar fine‑tuning ligero.»

    MIMarco Ibáñez
    LoRA: ajustar un modelo gigante tocando solo una fracción mínima de sus pesosPDF→
InicioGuardadoCuradoresEntrar