Slam

April 2, 2025 ยท View on GitHub

The official code for "Slamming: Training a Speech Language Model on One GPU in a Day".

๐ŸŒ Project | ๐Ÿ“ƒ Paper | ๐Ÿค— Models & Datasets

https://pages.cs.huji.ac.il/adiyoss-lab/slamming/

Results

We provide some results for our pre-trained models, compared to other SLMs.

ModelGPUsParamsNum TokenssBLIMP โ†‘sStoryCloze โ†‘tStoryCloze โ†‘GenPPL โ†“Auto-BLEU โ†“
Speech only pre-training
GSLM8ร—V100100M1B54.253.366.6โ€”โ€”
SyllableLM4ร—A40300M16B63.7โ€”75.4โ€”โ€”
TWIST-350M8ร—V100305M10.8B56.2โ€”โ€”137.33.46
TWIST-1.3B32ร—V1001B10.8B57.052.470.6131.83.20
TWIST-7B32ร—V1007B36B59.055.374.193.743.06
TWIST-13B32ร—V10013B36B59.255.476.4โ€”โ€”
Scaled Optimalโ€”823M82B61.356.778.0โ€”โ€”
Moshi?ร—H1007B?58.958.781.8โ€”โ€”
SpiritLM64ร—A1007B100B58.054.872.9โ€”โ€”
With text / preference optimization
Scaling Interleavingโ€”9B~1Tโ€”62.482.9โ€”โ€”
Moshi?ร—H1007B~720B58.860.883.0โ€”โ€”
SpiritLM64ร—A1007B100B58.361.082.9โ€”โ€”
AlignSLM-1.3B64ร—A1001B10.8B + ~158B59.855.080.0โ€”โ€”
AlignSLM-7B64ร—A1007B36B + ~158B62.361.186.8โ€”โ€”
Ours (Slam)
Slam (-DPO)2ร—A100358M16.7B58.5358.1580.7167.33.25
Slam1ร—A5000358M1.4B + 5M58.8658.0482.0462.83.88
Slam (scaled)2ร—A100358M16.7B + 9M61.1161.3084.1846.63.75

Citation

If you use this work, please cite our paper:

@misc{maimon2025slamming,
      title={Slamming: Training a Speech Language Model on One GPU in a Day}, 
      author={Gallil Maimon and Avishai Elmakies and Yossi Adi},
      year={2025},
      eprint={2502.15814},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2502.15814}, 
}