Leaderboard

April 22, 2025 Β· View on GitHub

We present the evaluation results on our own devices for reference. All models were evaluated uniformly on Spec-Bench using the same device and the testing environment. We report the mean speedup over 3 different runs and #mean accepted tokens per decoding step (which is 1.00 for vanilla autoregressive decoding).

❗️It is important to note that model speedup rates may differ across various devices. For more precise speedup metrics, we recommend conducting evaluations of specific models on your intended devices.

πŸ€” This is a gentle reminder that while speedup is the primary metric for assessing Speculative Decoding methods, other benefits are worth considering. For example, PLD, Lookahead, and Recycling are plug-and-play methods that require minimal extra parameters, making them easier to integrate into a wider range of models.

Leaderboard on 3090

  • Device: a single NVIDIA GeForce RTX 3090 GPU (24GB) with 12 CPU cores
  • Testing environment: Pytorch 2.5.1, under CUDA 12.1
  • Experimental Settings: Vicuna-7B-v1.3, greedy decoding, FP16 precision, batch size = 1
ModelsMulti-turn ConversationTranslationSumma-rizationQuestion AnsweringMathematical ReasoningRetrieval-aug. Generation#Mean Accepted TokensOverall
SAMD[EAGLE2]πŸ…2.85x1.83x2.64x2.15x2.63x2.10x4.612.38x
EAGLE2πŸ₯ˆ2.56x1.78x2.09x2.07x2.66x1.86x4.352.19x
EAGLEπŸ₯‰2.31x1.72x2.00x1.91x2.38x1.75x3.572.03x
Hydra2.18x1.79x1.66x1.85x2.28x1.62x3.261.91x
SpS1.94x1.37x1.96x1.86x1.81x1.83x2.281.79x
PLD1.64x1.15x2.46x1.28x1.72x1.71x1.731.64x
Medusa1.61x1.39x1.28x1.40x1.64x1.25x2.321.44x
Recycling1.42x1.29x1.43x1.30x1.59x1.36x2.731.40x
REST1.44x1.15x1.17x1.35x1.30x1.26x1.631.28x
Lookahead1.17x1.00x1.11x1.06x1.32x1.06x1.641.13x

Leaderboard on A100

  • Device: a single NVIDIA A100 GPU (80GB) with 96 CPU cores
  • Testing environment: Pytorch 2.5.1, under CUDA 11.5
  • Experimental Settings: greedy decoding, FP16 precision, batch size = 1

Vicuna-7B-v1.3

ModelsMulti-turn ConversationTranslationSumma-rizationQuestion AnsweringMathematical ReasoningRetrieval-aug. Generation#Mean Accepted TokensOverall
SAMD[EAGLE2]πŸ…3.30x2.01x3.19x2.36x2.96x2.52x4.582.73x
EAGLE2πŸ₯ˆ2.84x1.88x2.34x2.15x2.79x2.13x4.342.36x
RecyclingπŸ₯‰2.37x2.02x2.27x2.08x2.53x2.02x2.732.22x
EAGLE2.45x1.77x2.08x1.93x2.44x1.87x3.582.10x
Hydra2.43x1.89x1.83x1.97x2.45x1.80x3.262.07x
Medusa1.97x1.65x1.57x1.65x1.94x1.49x2.311.71x
PLD1.60x1.06x2.66x1.19x1.62x1.86x1.751.66x
SpS1.66x1.13x1.71x1.50x1.47x1.66x2.281.52x
REST1.63x1.31x1.36x1.66x1.21x1.73x1.821.48x
Lookahead1.47x1.14x1.36x1.25x1.57x1.22x1.641.34x

Vicuna-13B-v1.3

ModelsMulti-turn ConversationTranslationSumma-rizationQuestion AnsweringMathematical ReasoningRetrieval-aug. Generation#Mean Accepted TokensOverall
EAGLE3πŸ…3.48x2.36x3.14x2.94x3.42x2.78x5.713.02x
SAMD[EAGLE2]πŸ₯ˆ3.38x2.11x2.96x2.35x3.16x2.67x4.522.77x
EAGLE2πŸ₯‰2.95x1.96x2.43x2.20x2.95x2.25x4.432.46x
Hydra2.58x1.99x1.94x2.08x2.62x1.95x3.352.20x
Recycling2.30x2.02x2.10x2.05x2.60x1.94x2.732.17x
EAGLE2.52x1.84x2.12x1.91x2.52x2.01x3.642.16x
Medusa2.05x1.71x1.62x1.69x2.08x1.61x2.391.80x
PLD1.54x1.03x2.30x1.05x1.65x1.82x1.671.56x
SpS1.67x1.15x1.71x1.43x1.58x1.70x2.191.54x
REST1.52x1.17x1.37x1.53x1.19x1.55x1.821.38x
Lookahead1.43x1.09x1.28x1.18x1.59x1.21x1.631.30x

Vicuna-33B-v1.3

ModelsMulti-turn ConversationTranslationSumma-rizationQuestion AnsweringMathematical ReasoningRetrieval-aug. Generation#Mean Accepted TokensOverall
EAGLE2πŸ…3.01x2.10x2.51x2.27x3.30x2.29x4.052.59x
SAMD[EAGLE2]πŸ₯ˆ3.10x2.07x2.69x2.21x3.13x2.33x4.072.59x
EAGLEπŸ₯‰2.75x2.04x2.42x2.16x2.97x2.20x3.392.43x
Hydra2.53x2.01x1.96x2.10x2.68x1.98x3.242.22x
Recycling1.88x1.67x1.84x1.71x2.15x1.69x2.621.83x
Medusa1.94x1.72x1.58x1.65x2.05x1.56x2.331.76x
SpS1.70x1.27x1.71x1.52x1.66x1.60x2.011.57x
REST1.63x1.27x1.45x1.61x1.30x1.61x1.801.48x
PLD1.42x1.06x1.93x1.07x1.54x1.42x1.541.40x
Lookahead1.32x1.10x1.20x1.17x1.56x1.15x1.611.25x