benchmark.md

September 1, 2023 · View on GitHub

Benchmark

OpenCompass Benchmark

Check OpenCompass Leaderboard for more details.

ModelVicuna-33BWeMix-LLaMA2-7BLLaMA-2-7B-ChatVicuna-7BLLaMA-2-7BAlpaca-7BLLaMA-7B
OVERALL5049.644.843.441.639.938.5
EXAM49.245.540.140.535.535.331.2
LANGUAGE44.945.14439.644.139.540.5
KNOWLEDGE61.359.454.351.753.344.649.6
UNDERSTANDING58.555.550.950.542.445.138
REASONING44.747.441.439.940.138.138.5
EXAMC-Eval37.837.531.933.332.529.927.3
 AGIEval32.831.328.626.621.824.320.6
 MMLU59.254.146.248.246.841.735.6
 CMMLU38.837.231.533.531.828.726.8
 GAOKAO-Bench23.91716.122.418.919.621.3
 ARC-c69.265.154.951.240.341.434.6
 ARC-e82.976.571.668.456.161.452.2
LANGUAGEWiC67.562.95551.25050.350.2
 CHID35.142.144.129.246.526.731.2
 AFQMC6968.56969696968.9
 WSC68.366.369.261.566.365.465.4
 TyDiQA22.624.821.621.726.820.722.5
 Flores6.75.85.2564.64.8
KNOWLEDGEBoolQ85.785.681.278.374.979.575.4
 CommonSenseQA7169.969.966.466.569.464.9
 TriviaQA61.256.146.445.652.825.146.3
 NaturalQuestions27.326.219.616.419.14.411.7
REASONINGCMNLI30.64236.14034.93334.6
 OCNLI30.836.236.435.432.130.333.6
 AX-b59.752.158.558.253.552.357.4
 AX-g53.95051.75055.147.250
 RTE52.756.755.2485255.650.9
 COPA71677272677272
 ReCoRD3.14522.520.332.722.914.9
 HellaSwag7976.274.272.87473.674.3
 PIQA80.678.676.278.778.378.378.6
 SIQA65.171.555.454.748.552.746.2
 MATH6.84.63.93.13.332.9
 GSM8K443326.314.916.7610
 DROP4444.428.728.227.223.127.9
 HumanEval15.829.312.210.412.89.212.8
 MBPP26.629.817.614.414.817.816.8
 BBH5242.435.637.538.232.833.5
UNDERSTANDINGC348.347.849.845.642.939.339
 RACE(Middle)7982.36263.940.254.436.8
 RACE(High)76.477.858.659.337.547.230.6
 OpenbookQA80.484.674.473.25765.434.6
 CSL58.153.858.85555.654.454.4
 LCSTS11.14.29.6119.14.36.7
 XSum27.432.820.824.119.727.320.5
 EPRSTMT73.846.257.553.146.246.246.2
 LAMBADA72.169.666.969.273.367.173.3