Adam: el optimizador por defecto de media industria explicado por sus autores
Probablemente el algoritmo más ejecutado del planeta ahora mismo, y casi nadie que lo usa lo ha leído. Es un paper corto y sorprendentemente legible: momento más escala adaptativa por parámetro, y listo. Lo recomiendo a quien entrena modelos con hiperparámetros heredados por superstición; entender qué hace beta1 quita muchos miedos.
Diederik Kingma, Jimmy Ba · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Adam te aclara qué hacen momento y adaptación por parámetro; Scaling Laws te muestra cómo la pérdida cae con datos/ parámetros y cómputo. Juntos te permiten distinguir si al escalar el problema es optimización o falta de capacidad/datos y así asignar presupuesto eficazmente.»
MIMarco IbáñezLas curvas suaves que convencieron a la industria de gastar miles de millonesPDF
«Entender Adam —cómo interactúan beta1/beta2, escalado adaptativo y tasa de aprendizaje efectiva— te da control para ajustar la optimización y regularización en entrenamientos LoRA. Resultado: adaptadores low‑rank que convergen más estable y rápido sin tanto ensayo y error.»
MIMarco IbáñezLoRA: ajustar un modelo gigante tocando solo una fracción mínima de sus pesosPDF