tilde-research GitHub avatar

online-kl-shampoo-release

tilde-research

在线KL Shampoo(OKLS)是一种零延迟的克罗内克因子化优化器,在语言模型规模下近似全矩阵AdaGrad,相比Muon实现了1.45倍的参数效率提升,同时保持约98%的训练吞吐量。

Stars

26

7 天增长

暂无数据

Fork 数

2

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-28

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它结合了KL最优的克罗内克预处理、新颖的缩放切比雪夫逆根方法以及零延迟协方差更新,在缩放实验中展示了显著的参数效率优势。

适合谁使用

  • 从事大型语言模型优化的研究人员
  • 寻求内存高效训练方法的实践者
  • 对高级克罗内克因子化优化器感兴趣的开发者
  • 关注训练吞吐量的机器学习工程师

典型使用场景

  • 训练基于Transformer的语言模型
  • 优化深度神经网络中的矩阵参数
  • 与Muon和AdamW进行参数效率对比基准测试
  • 大规模二阶优化方法的研究

项目优势

  • 零延迟更新确保当前梯度的信息立即被使用
  • 缩放CANS耦合牛顿-舒尔茨迭代通过27次矩阵乘法高效计算逆根
  • 相比Muon实现1.45倍参数效率,吞吐量保持98%
  • 集成了muP形状缩放和AdamC解耦权重衰减以增强稳定性

使用前须知

  • 需要CUDA GPU和支持特定FP16/FP32运算的较新PyTorch版本
  • 仅适用于矩阵参数;嵌入层、归一化层和偏置需使用其他优化器
  • 纯PyTorch实现,不含博客中描述的生产级分布式状态卸载和融合内核
  • 由于存储FP32动量及两份协方差因子副本,内存占用较高

README 快速开始

Usage

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
gavamedia
精选
gavamedia GitHub avatar

deltafin

Deltafin is a research project that runs the 2.8-trillion-parameter Mixture-of-Experts model Kimi K3 on a single Apple Silicon Mac (e.g., M1 Max with 64 GB) at about 16 seconds per token, using exact, reproducible inference with local or streaming expert loading.

AI 与机器学习大语言模型
304
jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660