gguf_alg_ext_acc.md

May 19, 2026 · View on GitHub

We use lm-eval for evaluation. For LLaMA, we enabled add_bos_token and removed @use_kernel_forward_from_hub("RMSNorm") in modeling_llama.py to stabilize accuracy during evaluation. All other settings follow the default configurations of AutoRound and lm-eval.

Results of V>0.12.3

lm-eval 0.4.9.1

transformers 4.57.6

1. Qwen3-8B 评测结果

Model / QuantAveragearc_challengearc_easyboolqhellaswaglambada_openaimmluopenbookqapiqatruthfulqa_mc1winogrande
bf160.63290.55630.83540.86700.57170.64390.72920.31600.76710.36470.6780
opt-rtn (2bit)0.58790.47530.79040.84310.49010.63520.65590.28400.73230.31330.6598
q2ks0.60600.51110.80260.84620.51070.62660.67360.31600.74920.33290.6906
opt-rtn (3bit)0.62000.54860.81520.85500.55000.62470.70300.31600.76060.36110.6654
q3ks0.62870.55800.83160.85660.55160.63850.70900.33000.76610.34880.6969
opt-rtn (4bit)0.63030.54690.83080.86450.56470.64540.72550.31200.76390.37090.6788
q4km0.63530.56060.83880.86730.56950.63920.72850.31800.76770.37700.6867

2. Qwen2.5-7B-Instruct 评测结果

Model / QuantAveragearc_challengearc_easyboolqhellaswaglambada_openaimmluopenbookqapiqatruthfulqa_mc1winogrande
BF160.65740.52820.81440.86420.62010.69530.71610.34800.79380.48230.7119
opt-rtn (2bit)0.62580.50940.79920.86120.54900.69940.65570.32200.76330.40150.6977
q2ks0.63880.52050.81270.86360.56520.69750.67410.33000.76880.44310.7127
q3ks-opt-rtn0.63800.50090.78700.85690.59640.70540.69080.34000.76880.45780.6756
q3ks0.64820.53580.81230.85750.60240.69860.70290.33400.77690.46630.6953
opt-rtn (4bit)0.65740.54350.82410.86090.61770.68970.71210.34400.79760.47610.7080
q4km0.65850.54780.81900.86300.62040.70040.71410.34200.79160.47740.7088

3. Llama-3.1-8B 评测结果

Model / QuantAveragearc_challengearc_easyboolqhellaswaglambada_openaimmluopenbookqapiqatruthfulqa_mc1winogrande
BF16 (Base 1)0.62350.50170.79970.80950.60170.75680.62160.34600.79600.27050.7316
BF16 (Base 2)0.62950.51540.81650.82170.60070.75350.63230.33400.79980.28640.7348
opt-rtn (2bit)0.55750.41210.74870.78070.51670.66990.47620.28600.75460.23380.6961
q2ks0.58490.45220.77400.78440.54150.70830.55270.30800.76770.26320.6969
q3ks-opt-rtn0.60540.45730.78450.80000.57790.75260.59290.33000.78780.25340.7174
q3ks0.61650.48890.80980.81160.58580.73960.62160.33000.78730.26810.7222
opt-rtn (4bit)0.62830.52470.81780.81930.60170.73980.63420.33200.79050.28150.7411
q4km0.62790.51790.81900.81740.60250.74360.63520.33600.79430.27660.7364

Results of V<=0.12.3

Average accuracy across lambada_openai, hellaswag, piqa, winogrande, truthfulqa_mc1, openbookqa, boolq, arc_easy, arc_challenge and mmlu.

methodschemeLlama-3.1-8BQwen2.5-7B-InstructQwen3-8bQwen3-30B-A3B-Instruct-2507
BF16-0.6295(100%)0.6571(100%)0.6322(100%)0.6746(100%)
Optimized RTNq2_k_s0.5535(87.92%)0.6266(95.35%)0.5901(93.35%)0.6386(94.66%)
AutoRound+alg_extq2_k_s0.5740(91.18%)0.6349(96.62%)0.5962(94.31%)0.6460(95.77%)
Optimized RTNq3_k_s0.6040(95.95%)0.6382(97.12%)0.6128(96.94%)0.6598(97.82%)
AutoRound+alg_extq3_k_s0.6081(96.59%)0.6503(98.97%)0.6252(98.89%)0.6622(98.17%)
Optimized RTNq3_k_m0.6083(96.63%)0.6418(97.68%)0.6194(97.97%)
AutoRound+alg_extq3_k_m0.6127(97.33%)0.6533(99.42%)0.6197(98.02%)
Optimized RTNq4_k_s0.6228(98.94%)0.6560(99.83%)0.6303(99.70%)0.6762(100.24%)
AutoRound+alg_extq4_k_s0.6239(99.11%)0.6605(100.51%)0.6320(99.98%)0.6777(100.46%)
Optimized RTNq4_k_m0.6252(99.32%)0.6558(99.80%)0.6296(99.59%)
AutoRound+alg_extq4_k_m0.6257(99.40%)0.6575(100.06%)0.6340(100.29%)

Time cost

modelOptimized RTNAutoRound+alg_ext
Llama-3.1-8B1m25s29m43s
Qwen2.5-7B-Instruct1m20s35m35s
Qwen3-8b1m29s47m58s
Qwen3-30B-A3B-Instruct-250725m12s12h47m39s