Organization,Availability,Division,SystemType,SystemName,Platform,Model,MlperfModel,Scenario,Result,Accuracy,number_of_nodes,host_processor_model_name,host_processors_per_node,host_processor_core_count,accelerator_model_name,accelerators_per_node,total_accelerators,Location,framework,operating_system,notes,compliance,errors,version,inferred,has_power,Units,weight_data_types,design_power_watts,PrivateID "AMD","available","closed","datacenter","8xMI350X_2xEPYC_9575F","8xMI350X_2xEPYC_9575F","dlrm-v3","dlrm-v3","Offline","10891.1","DLRM_NE: 0.8677294228203597 DLRM_ACC: 0.6964170290002015 DLRM_AUC: 0.7862871466027813","1","AMD EPYC 9575F","2","64","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/AMD/results/8xMI350X_2xEPYC_9575F/dlrm-v3/Offline/performance/run_1","PyTorch 2.10.0+rocm7.2.3, Triton 3.6.0, ROCm 7.2.3","Ubuntu 24.04 LTS (Noble Numbat), kernel 6.8.0-38-generic","Measured on host smci350-rck-g03-d13-31: 8x AMD Instinct MI350X / 2x AMD EPYC 9575F (64 cores/socket, 2 sockets). Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm b32 q7,250 GOLD stack (full-causal, C1-off) with degree-5 production gate and TEST08 determinism fixes; container dlrmv3-e2e723 (ROCm 7.2.3).","closed","0","v6.1","0","False","Samples/s","fp16,bf16,fp8","None","" "AMD","available","closed","datacenter","8xMI350X_2xEPYC_9575F","8xMI350X_2xEPYC_9575F","dlrm-v3","dlrm-v3","Server","9297.78","DLRM_NE: 0.867728327062296 DLRM_ACC: 0.696416918732384 DLRM_AUC: 0.786287540637186","1","AMD EPYC 9575F","2","64","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/AMD/results/8xMI350X_2xEPYC_9575F/dlrm-v3/Server/performance/run_1","PyTorch 2.10.0+rocm7.2.3, Triton 3.6.0, ROCm 7.2.3","Ubuntu 24.04 LTS (Noble Numbat), kernel 6.8.0-38-generic","Measured on host smci350-rck-g03-d13-31: 8x AMD Instinct MI350X / 2x AMD EPYC 9575F (64 cores/socket, 2 sockets). Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm b32 q7,250 GOLD stack (full-causal, C1-off) with degree-5 production gate and TEST08 determinism fixes; container dlrmv3-e2e723 (ROCm 7.2.3).","closed","0","v6.1","0","False","Queries/s","fp16,bf16,fp8","None","" "AMD","available","closed","datacenter","Quanta Grand Teton 1.5 MI350","8xMI350X_2xEPYC_9655","wan-2.2-t2v-a14b","text_to_video","Offline","0.0565013","vbench_score: 70.1221","1","AMD EPYC 9655","2","96","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/AMD/results/8xMI350X_2xEPYC_9655/wan-2.2-t2v-a14b/Offline/performance/run_1","xDiT, xfuser 0.4.5, PyTorch 2.9.1+gitff65f5b, ROCm 7.13.0","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Samples/s","bf16, fp8, fp4","None","" "AMD","available","closed","datacenter","Quanta Grand Teton 1.5 MI350","8xMI350X_2xEPYC_9655","wan-2.2-t2v-a14b","text_to_video","SingleStream","20.603024726","vbench_score: 70.1582","1","AMD EPYC 9655","2","96","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/AMD/results/8xMI350X_2xEPYC_9655/wan-2.2-t2v-a14b/SingleStream/performance/run_1","xDiT, xfuser 0.4.5, PyTorch 2.9.1+gitff65f5b, ROCm 7.13.0","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Latency (s)","bf16, fp8, fp4","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","dlrm-v3","dlrm-v3","Offline","13027.7","DLRM_NE: 0.8681176645656181 DLRM_ACC: 0.6963383089448092 DLRM_AUC: 0.7862169525257562","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/dlrm-v3/Offline/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Samples/s","fp16,bf16,fp8","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","dlrm-v3","dlrm-v3","Server","12198.8","DLRM_NE: 0.8681164332983042 DLRM_ACC: 0.696331698458935 DLRM_AUC: 0.786212286822123","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/dlrm-v3/Server/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Queries/s","fp16,bf16,fp8","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","gpt-oss-120b","gpt-oss-120b","Offline","121818.0","exact_match: 83.706","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/gpt-oss-120b/Offline/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","gpt-oss-120b","gpt-oss-120b","Server","113241.0","exact_match: 83.451","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/gpt-oss-120b/Server/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","llama2-70b-99.9","llama2-70b-99.9","Interactive","73191.5","ROUGE1: 44.5125 ROUGE2: 22.1593 ROUGEL: 28.9205 TOKENS_PER_SAMPLE: 284.1","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/llama2-70b-99.9/Interactive/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","llama2-70b-99.9","llama2-70b-99.9","Offline","106517.0","ROUGE1: 44.5481 ROUGE2: 22.1846 ROUGEL: 28.9482 TOKENS_PER_SAMPLE: 283.2","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/llama2-70b-99.9/Offline/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","llama2-70b-99.9","llama2-70b-99.9","Server","103275.0","ROUGE1: 44.5266 ROUGE2: 22.1733 ROUGEL: 28.9289 TOKENS_PER_SAMPLE: 284.2","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/llama2-70b-99.9/Server/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","wan-2.2-t2v-a14b","text_to_video","Offline","0.0731282","vbench_score: 69.8899","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/wan-2.2-t2v-a14b/Offline/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Samples/s","bf16, fp8, fp4","None","" "AMD","available","closed","datacenter","smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)","8xMI355X_2xEPYC_9575F","wan-2.2-t2v-a14b","text_to_video","SingleStream","16.124484197","vbench_score: 69.9691","1","AMD EPYC 9575F","8","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/AMD/results/8xMI355X_2xEPYC_9575F/wan-2.2-t2v-a14b/SingleStream/performance/run_1","PyTorch 2.10.0+git8514f05, ROCm 7.2.2","Ubuntu 22.04.5 LTS","","closed","0","v6.1","0","False","Latency (s)","bf16, fp8, fp4","None","" "AMD","available","closed","datacenter","9x8xMI355X_2xEPYC_9575F","9x8xMI355X_2xEPYC_9575F","gpt-oss-120b","gpt-oss-120b","Offline","1039900.0","exact_match: 83.230","9","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","72","./closed/AMD/results/9x8xMI355X_2xEPYC_9575F/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.1.dev0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","9 nodes x 8 AMD Instinct MI355X (gfx950) = 72 GPUs, 288GB HBM3E each; distributed asynchronous ZMQ backend. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization; 72-GPU distributed ZMQ (async server / sync offline)","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "AMD","available","closed","datacenter","9x8xMI355X_2xEPYC_9575F","9x8xMI355X_2xEPYC_9575F","gpt-oss-120b","gpt-oss-120b","Server","964468.0","exact_match: 83.446","9","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","72","./closed/AMD/results/9x8xMI355X_2xEPYC_9575F/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.1.dev0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","9 nodes x 8 AMD Instinct MI355X (gfx950) = 72 GPUs, 288GB HBM3E each; distributed asynchronous ZMQ backend. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization; 72-GPU distributed ZMQ (async server / sync offline)","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "ASUSTeK","available","closed","datacenter","XA NB3I-E12","XA_NB3I-E12_B300x8_TRT","deepseek-r1","deepseek-r1","Offline","69846.9","exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3759.735870556062","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/ASUSTeK/results/XA_NB3I-E12_B300x8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "ASUSTeK","available","closed","datacenter","XA NB3I-E12","XA_NB3I-E12_B300x8_TRT","deepseek-r1","deepseek-r1","Server","54568.6","exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3802.827256153145","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/ASUSTeK/results/XA_NB3I-E12_B300x8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "ASUSTeK","available","closed","datacenter","XA NB3I-E12","XA_NB3I-E12_B300x8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","109368.0","exact_match: 83.572","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/ASUSTeK/results/XA_NB3I-E12_B300x8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "ASUSTeK","available","closed","datacenter","XA NB3I-E12","XA_NB3I-E12_B300x8_TRT","gpt-oss-120b","gpt-oss-120b","Server","109949.0","exact_match: 83.403","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/ASUSTeK/results/XA_NB3I-E12_B300x8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "ASUSTeK","available","closed","datacenter","XA NB3I-E12","XA_NB3I-E12_B300x8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","113007.0","ROUGE1: 44.7974 ROUGE2: 22.3739 ROUGEL: 29.1541 TOKENS_PER_SAMPLE: 272.7","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/ASUSTeK/results/XA_NB3I-E12_B300x8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "ASUSTeK","available","closed","datacenter","XA NB3I-E12","XA_NB3I-E12_B300x8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","113455.0","ROUGE1: 44.8853 ROUGE2: 22.409 ROUGEL: 29.2169 TOKENS_PER_SAMPLE: 272.2","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/ASUSTeK/results/XA_NB3I-E12_B300x8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Atlas_Inference","available","closed","edge","NVIDIA DGX Spark (GB10 Grace Blackwell Superchip)","DGX_Spark_GB10","qwen3.6-27b","agentic edge","SingleStream","3807.66351136147","0.8723618090452261","1","NVIDIA Grace (20-core Arm v9.2)","1","20","NVIDIA GB10","1","1","./closed/Atlas_Inference/results/DGX_Spark_GB10/qwen3.6-27b/SingleStream/performance/run_1","Atlas (spark), CUDA NVFP4","Ubuntu 24.04.4 LTS","NVIDIA DGX Spark GB10 Grace Blackwell Superchip with 128 GB unified LPDDR5X memory (~273 GB/s) shared between the Grace CPU and the GB10 GPU; roughly 119-121 GiB of that is reportable to the OS as usable. GB10 GPU is Blackwell, sm_121a / compute capability 12.1.. Atlas NVFP4 serve; chain-widened MTP verify K=4 (3 drafts) + drafter context prefill/carry; GDN register-resident warm-replay (ATLAS_GDN_REGRESIDENT, merged default-on upstream as 063d87ee); see results/.../README.md.","closed","0","v6.1","1","False","Latency (ms)","nvfp4 (E2M1 4-bit + FP8 block scales), GDN included","None","" "Atlas_Inference","available","closed","edge","AMD Strix Halo desktop (Ryzen AI Max+ 395 / Radeon 8060S)","Strix_Halo","qwen3.6-27b","agentic edge","SingleStream","7058.989199685204","0.8623115577889447","1","AMD Ryzen AI Max+ 395","1","16","AMD Radeon 8060S Graphics","1","1","./closed/Atlas_Inference/results/Strix_Halo/qwen3.6-27b/SingleStream/performance/run_1","Atlas (spark), native-HIP NVFP4","Ubuntu 24.04 (Linux), ROCm 7.13","AMD Strix Halo APU (Ryzen AI Max+ 395) with 128 GB unified LPDDR5X memory shared between the CPU and the integrated GPU; ~62.5 GB of that is GPU-addressable via GTT. Radeon 8060S Graphics is gfx1151, RDNA3.5.. Atlas NVFP4 native-HIP serve; MTP K=3 (2 drafts) + drafter context-prefill; see results/.../README.md.","closed","0","v6.1","1","False","Latency (ms)","nvfp4 (E2M1 4-bit + FP8 block scales)","None","" "Azure","available","closed","datacenter","Azure GB200 NVL72 (288x GB200-186GB_aarch64, TensorRT)","Azure-GB200-NVL72_186GBx288","deepseek-r1","deepseek-r1","Offline","2091190.0","exact_match: 81.56335460346399 TOKENS_PER_SAMPLE: 3758.743163172288","72","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","288","./closed/Azure/results/Azure-GB200-NVL72_186GBx288/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Azure","available","closed","datacenter","Azure GB200 NVL72 (288x GB200-186GB_aarch64, TensorRT)","Azure-GB200-NVL72_186GBx288","deepseek-r1","deepseek-r1","Server","1598510.0","exact_match: 80.85688240656336 TOKENS_PER_SAMPLE: 3746.623518687329","72","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","288","./closed/Azure/results/Azure-GB200-NVL72_186GBx288/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Azure","available","closed","datacenter","Azure GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","Azure-GB200-NVL72_186GBx72","deepseek-r1","deepseek-r1","Offline","542075.0","exact_match: 81.35824977210574 TOKENS_PER_SAMPLE: 3739.669553327256","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/Azure/results/Azure-GB200-NVL72_186GBx72/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Azure","available","closed","datacenter","Azure GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","Azure-GB200-NVL72_186GBx72","deepseek-r1","deepseek-r1","Server","426796.0","exact_match: 81.51777575205105 TOKENS_PER_SAMPLE: 3732.908158614403","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/Azure/results/Azure-GB200-NVL72_186GBx72/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Azure","available","closed","datacenter","Azure GB300 NVL72 (72x GB300-288GB_aarch64 TensorRT)","Azure-GB300-NVL72_288GBx72","deepseek-r1","deepseek-r1","Interactive","260098.0","exact_match: 80.81130355515042 TOKENS_PER_SAMPLE: 3720.641750227894","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Azure/results/Azure-GB300-NVL72_288GBx72/deepseek-r1/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Azure","available","closed","datacenter","Azure GB300 NVL72 (72x GB300-288GB_aarch64 TensorRT)","Azure-GB300-NVL72_288GBx72","deepseek-r1","deepseek-r1","Offline","661143.0","exact_match: 81.47219690063811 TOKENS_PER_SAMPLE: 3779.8644029170464","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Azure/results/Azure-GB300-NVL72_288GBx72/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Azure","available","closed","datacenter","Azure GB300 NVL72 (72x GB300-288GB_aarch64 TensorRT)","Azure-GB300-NVL72_288GBx72","deepseek-r1","deepseek-r1","Server","589391.0","exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3771.7791704649044","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Azure/results/Azure-GB300-NVL72_288GBx72/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C240M8_RTXPro4500_32GBx5_TRT","llama3.1-8b","llama3.1-8b","Interactive","8494.68","ROUGE1: 38.7733 ROUGE2: 16.0169 ROUGEL: 24.5358 ROUGELSUM: 35.6947 GEN_LEN: 8179270","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA RTX PRO 4500 Blackwell","5","5","./closed/Cisco/results/C240M8_RTXPro4500_32GBx5_TRT/llama3.1-8b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C240M8_RTXPro4500_32GBx5_TRT","llama3.1-8b","llama3.1-8b","Offline","12017.7","ROUGE1: 38.7698 ROUGE2: 16.0132 ROUGEL: 24.5304 ROUGELSUM: 35.6924 GEN_LEN: 8178850","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA RTX PRO 4500 Blackwell","5","5","./closed/Cisco/results/C240M8_RTXPro4500_32GBx5_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C240M8_RTXPro4500_32GBx5_TRT","llama3.1-8b","llama3.1-8b","Server","11426.1","ROUGE1: 38.7615 ROUGE2: 16.0056 ROUGEL: 24.5235 ROUGELSUM: 35.6866 GEN_LEN: 8178120","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA RTX PRO 4500 Blackwell","5","5","./closed/Cisco/results/C240M8_RTXPro4500_32GBx5_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C240M8_RTXPro4500_32GBx5_TRT","whisper","whisper","Offline","4808.98","ACCURACY: 97.83682442399383","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA RTX PRO 4500 Blackwell","5","5","./closed/Cisco/results/C240M8_RTXPro4500_32GBx5_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Samples/s","fp16","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C845A_M8_RTXPro4500_32GBx8_TRT","llama3.1-8b","llama3.1-8b","Interactive","14316.2","ROUGE1: 38.7705 ROUGE2: 16.0134 ROUGEL: 24.5326 ROUGELSUM: 35.6934 GEN_LEN: 8179270","1","AMD EPYC 9655","2","96","NVIDIA RTX PRO 4500 Blackwell","8","8","./closed/Cisco/results/C845A_M8_RTXPro4500_32GBx8_TRT/llama3.1-8b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C845A_M8_RTXPro4500_32GBx8_TRT","llama3.1-8b","llama3.1-8b","Offline","18800.9","ROUGE1: 38.7819 ROUGE2: 16.0194 ROUGEL: 24.5377 ROUGELSUM: 35.7086 GEN_LEN: 8178827","1","AMD EPYC 9655","2","96","NVIDIA RTX PRO 4500 Blackwell","8","8","./closed/Cisco/results/C845A_M8_RTXPro4500_32GBx8_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C845A_M8_RTXPro4500_32GBx8_TRT","llama3.1-8b","llama3.1-8b","Server","18186.2","ROUGE1: 38.7633 ROUGE2: 16.0118 ROUGEL: 24.5232 ROUGELSUM: 35.6834 GEN_LEN: 8178277","1","AMD EPYC 9655","2","96","NVIDIA RTX PRO 4500 Blackwell","8","8","./closed/Cisco/results/C845A_M8_RTXPro4500_32GBx8_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","C845A_M8_RTXPro4500_32GBx8_TRT","whisper","whisper","Offline","7777.66","ACCURACY: 97.82825927653055","1","AMD EPYC 9655","2","96","NVIDIA RTX PRO 4500 Blackwell","8","8","./closed/Cisco/results/C845A_M8_RTXPro4500_32GBx8_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Samples/s","fp16","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","15508.4","exact_match: 83.570","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","14817.4","exact_match: 84.117","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","29904.0","ROUGE1: 44.7661 ROUGE2: 22.3346 ROUGEL: 29.1319 TOKENS_PER_SAMPLE: 274.4","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","29316.4","ROUGE1: 44.7625 ROUGE2: 22.3336 ROUGEL: 29.1052 TOKENS_PER_SAMPLE: 273.5","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","llama3.1-8b","llama3.1-8b","Interactive","46164.4","ROUGE1: 38.7602 ROUGE2: 15.9962 ROUGEL: 24.5347 ROUGELSUM: 35.6851 GEN_LEN: 8180275","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/llama3.1-8b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","llama3.1-8b","llama3.1-8b","Offline","50453.7","ROUGE1: 38.769 ROUGE2: 16.0147 ROUGEL: 24.5312 ROUGELSUM: 35.6942 GEN_LEN: 8178808","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","llama3.1-8b","llama3.1-8b","Server","49174.7","ROUGE1: 38.7598 ROUGE2: 16.0015 ROUGEL: 24.5351 ROUGELSUM: 35.6872 GEN_LEN: 8179087","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)","C845A_M8_RTXPro6000_96GBx8_TRT","whisper","whisper","Offline","18991.8","ACCURACY: 97.8425345223027","1","AMD EPYC 9575F","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Cisco/results/C845A_M8_RTXPro6000_96GBx8_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Samples/s","fp16","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","70325.4","exact_match: 80.92525068368278 TOKENS_PER_SAMPLE: 3782.986326344576","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","deepseek-r1","deepseek-r1","Server","66171.6","exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3811.0783956244304","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","llama3.1-8b","llama3.1-8b","Interactive","129168.0","ROUGE1: 38.4828 ROUGE2: 15.9176 ROUGEL: 24.3231 ROUGELSUM: 35.6535 GEN_LEN: 8186168","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/llama3.1-8b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","llama3.1-8b","llama3.1-8b","Offline","171114.0","ROUGE1: 38.4898 ROUGE2: 15.9329 ROUGEL: 24.3413 ROUGELSUM: 35.6705 GEN_LEN: 8186559","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","llama3.1-8b","llama3.1-8b","Server","173950.0","ROUGE1: 38.4912 ROUGE2: 15.9156 ROUGEL: 24.3266 ROUGELSUM: 35.6593 GEN_LEN: 8186471","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.06127496829802798","0.7028246725986534","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","fp8","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","20.004214518034722","0.6994130989447821","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "Cisco","available","closed","datacenter","Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)","C880A_M8_B300_270GBx8_TRT","whisper","whisper","Offline","52221.8","ACCURACY: 97.8263559104276","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Cisco/results/C880A_M8_B300_270GBx8_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Samples/s","fp16","None","" "Cisco","available","closed","datacenter","Cisco_UCS_B300x16_G200_4x2_RO","Cisco_UCS_B300x16_G200_4x2_RO","deepseek-r1","deepseek-r1","Offline","137067.0","exact_match: 81.33546034639927 TOKENS_PER_SAMPLE: 3825.4619416590704","2","Intel(R) Xeon(R) 6776P","2","128","NVIDIA B300-SXM-270GB","8","16","./closed/Cisco/results/Cisco_UCS_B300x16_G200_4x2_RO/deepseek-r1/Offline/performance/run_1","TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco_UCS_B300x16_G200_4x2_RO","Cisco_UCS_B300x16_G200_4x2_RO","deepseek-r1","deepseek-r1","Server","88915.5","exact_match: 81.28988149498633 TOKENS_PER_SAMPLE: 3794.9457611668186","2","Intel(R) Xeon(R) 6776P","2","128","NVIDIA B300-SXM-270GB","8","16","./closed/Cisco/results/Cisco_UCS_B300x16_G200_4x2_RO/deepseek-r1/Server/performance/run_1","TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco_UCS_B300x16_G200_4x2_RO","Cisco_UCS_B300x16_G200_4x2_RO","gpt-oss-120b","gpt-oss-120b","Offline","220527.0","exact_match: 83.296","2","Intel(R) Xeon(R) 6776P","2","128","NVIDIA B300-SXM-270GB","8","16","./closed/Cisco/results/Cisco_UCS_B300x16_G200_4x2_RO/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco_UCS_B300x16_G200_4x2_RO","Cisco_UCS_B300x16_G200_4x2_RO","gpt-oss-120b","gpt-oss-120b","Server","214774.0","exact_match: 83.572","2","Intel(R) Xeon(R) 6776P","2","128","NVIDIA B300-SXM-270GB","8","16","./closed/Cisco/results/Cisco_UCS_B300x16_G200_4x2_RO/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco_UCS_B300x16_G200_4x2_RO","Cisco_UCS_B300x16_G200_4x2_RO","llama2-70b-99.9","llama2-70b-99.9","Offline","227570.0","ROUGE1: 44.8082 ROUGE2: 22.3989 ROUGEL: 29.1755 TOKENS_PER_SAMPLE: 272.1","2","Intel(R) Xeon(R) 6776P","2","128","NVIDIA B300-SXM-270GB","8","16","./closed/Cisco/results/Cisco_UCS_B300x16_G200_4x2_RO/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco_UCS_B300x16_G200_4x2_RO","Cisco_UCS_B300x16_G200_4x2_RO","llama2-70b-99.9","llama2-70b-99.9","Server","179597.0","ROUGE1: 44.7969 ROUGE2: 22.3691 ROUGEL: 29.184 TOKENS_PER_SAMPLE: 272.7","2","Intel(R) Xeon(R) 6776P","2","128","NVIDIA B300-SXM-270GB","8","16","./closed/Cisco/results/Cisco_UCS_B300x16_G200_4x2_RO/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","gpt-oss-120b","gpt-oss-120b","Offline","94249.3","exact_match: 83.57105741751104","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/gpt-oss-120b/Offline/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","gpt-oss-120b","gpt-oss-120b","Server","73357.6","exact_match: 83.43465835281891","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/gpt-oss-120b/Server/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","llama2-70b-99.9","llama2-70b-99.9","Interactive","70354.5","ROUGE1: 44.5557 ROUGE2: 22.154 ROUGEL: 28.907 TOKENS_PER_SAMPLE: 283.6","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/llama2-70b-99.9/Interactive/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","1","False","Tokens/s","fp8,fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","llama2-70b-99.9","llama2-70b-99.9","Offline","99683.8","ROUGE1: 44.4169 ROUGE2: 22.068 ROUGEL: 28.7957 TOKENS_PER_SAMPLE: 286.6","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/llama2-70b-99.9/Offline/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp8,fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","llama2-70b-99.9","llama2-70b-99.9","Server","95104.6","ROUGE1: 44.6044 ROUGE2: 22.1926 ROUGEL: 28.9466 TOKENS_PER_SAMPLE: 284.7","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/llama2-70b-99.9/Server/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp8,fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","llama3.1-8b","llama3.1-8b","Interactive","121557.0","ROUGE1: 38.6105 ROUGE2: 16.0699 ROUGEL: 24.5048 ROUGELSUM: 35.5444 GEN_LEN: 8148492","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/llama3.1-8b/Interactive/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","1","False","Tokens/s","fp8,fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","llama3.1-8b","llama3.1-8b","Offline","163292.0","ROUGE1: 38.5675 ROUGE2: 16.0757 ROUGEL: 24.5063 ROUGELSUM: 35.5154 GEN_LEN: 8141814","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/llama3.1-8b/Offline/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp8,fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR","Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR","llama3.1-8b","llama3.1-8b","Server","161110.0","ROUGE1: 38.6437 ROUGE2: 16.1045 ROUGEL: 24.5278 ROUGELSUM: 35.5601 GEN_LEN: 8147699","2","AMD EPYC","2","128","NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e","8","16","./closed/Cisco/results/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR/llama3.1-8b/Server/performance/run_1","vLLM","Ubuntu 22.04","","closed","0","v6.1","0","False","Tokens/s","fp8,fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","X210M8_X580P_RTXPro4500_32GBx4_TRT","llama3.1-8b","llama3.1-8b","Interactive","6883.94","ROUGE1: 38.7575 ROUGE2: 16.0054 ROUGEL: 24.5233 ROUGELSUM: 35.6829 GEN_LEN: 8179124","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 4500 Blackwell","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro4500_32GBx4_TRT/llama3.1-8b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","X210M8_X580P_RTXPro4500_32GBx4_TRT","llama3.1-8b","llama3.1-8b","Offline","9518.66","ROUGE1: 38.7664 ROUGE2: 16.0107 ROUGEL: 24.5281 ROUGELSUM: 35.6917 GEN_LEN: 8178365","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 4500 Blackwell","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro4500_32GBx4_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","X210M8_X580P_RTXPro4500_32GBx4_TRT","llama3.1-8b","llama3.1-8b","Server","9277.73","ROUGE1: 38.7836 ROUGE2: 16.0298 ROUGEL: 24.5367 ROUGELSUM: 35.7048 GEN_LEN: 8178628","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 4500 Blackwell","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro4500_32GBx4_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)","X210M8_X580P_RTXPro4500_32GBx4_TRT","whisper","whisper","Offline","3877.67","ACCURACY: 97.86822996469256","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 4500 Blackwell","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro4500_32GBx4_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","","closed","0","v6.1","0","False","Samples/s","fp16","None","" "Cisco","available","closed","datacenter","Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X210M8_X580P_RTXPro6000_96GBx4_TRT","gpt-oss-120b","gpt-oss-120b","Offline","7801.36","exact_match: 83.969","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro6000_96GBx4_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X210M8_X580P_RTXPro6000_96GBx4_TRT","gpt-oss-120b","gpt-oss-120b","Server","6950.76","exact_match: 83.637","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro6000_96GBx4_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X210M8_X580P_RTXPro6000_96GBx4_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","14860.7","ROUGE1: 44.7766 ROUGE2: 22.3407 ROUGEL: 29.1379 TOKENS_PER_SAMPLE: 275.2","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro6000_96GBx4_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X210M8_X580P_RTXPro6000_96GBx4_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","14333.3","ROUGE1: 44.7151 ROUGE2: 22.3389 ROUGEL: 29.0874 TOKENS_PER_SAMPLE: 274.6","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X210M8_X580P_RTXPro6000_96GBx4_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X215M8_X580P_RTXPro6000_96GBx4_TRT","llama3.1-8b","llama3.1-8b","Interactive","22447.0","ROUGE1: 38.7706 ROUGE2: 16.012 ROUGEL: 24.5423 ROUGELSUM: 35.699 GEN_LEN: 8179184","1","AMD EPYC 9845","2","160","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X215M8_X580P_RTXPro6000_96GBx4_TRT/llama3.1-8b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X215M8_X580P_RTXPro6000_96GBx4_TRT","llama3.1-8b","llama3.1-8b","Offline","24913.5","ROUGE1: 38.7701 ROUGE2: 16.0155 ROUGEL: 24.534 ROUGELSUM: 35.6954 GEN_LEN: 8178898","1","AMD EPYC 9845","2","160","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X215M8_X580P_RTXPro6000_96GBx4_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X215M8_X580P_RTXPro6000_96GBx4_TRT","llama3.1-8b","llama3.1-8b","Server","24498.6","ROUGE1: 38.766 ROUGE2: 16.0082 ROUGEL: 24.5262 ROUGELSUM: 35.6898 GEN_LEN: 8179590","1","AMD EPYC 9845","2","160","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X215M8_X580P_RTXPro6000_96GBx4_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Cisco","available","closed","datacenter","Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)","X215M8_X580P_RTXPro6000_96GBx4_TRT","whisper","whisper","Offline","9236.94","ACCURACY: 97.8339693748394","1","AMD EPYC 9845","2","160","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/Cisco/results/X215M8_X580P_RTXPro6000_96GBx4_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Samples/s","fp16","None","" "Cisco","available","closed","datacenter","X410M8_1_node_4S_GNR_86C","X410M8_1_node_4S_GNR_86C","llama3_1-8b","llama3.1-8b","Offline","2068.63","ROUGE1: 38.6284 ROUGE2: 15.804 ROUGEL: 24.4033 ROUGELSUM: 35.6616 GEN_LEN: 8196513","1","Intel(R) Xeon(R) 6788P","4","86","N/A","0","0","./closed/Cisco/results/X410M8_1_node_4S_GNR_86C/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3","","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Cisco","available","closed","datacenter","X410M8_1_node_4S_GNR_86C","X410M8_1_node_4S_GNR_86C","llama3_1-8b","llama3.1-8b","Server","1030.45","ROUGE1: 38.8382 ROUGE2: 16.0493 ROUGEL: 24.6331 ROUGELSUM: 35.8769 GEN_LEN: 8171982","1","Intel(R) Xeon(R) 6788P","4","86","N/A","0","0","./closed/Cisco/results/X410M8_1_node_4S_GNR_86C/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 24.04.3","","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Cisco","available","closed","datacenter","X410M8_1_node_4S_GNR_86C","X410M8_1_node_4S_GNR_86C","whisper","whisper","Offline","2970.57","ACCURACY: 97.94665880091725","1","Intel(R) Xeon(R) 6788P","4","86","N/A","0","0","./closed/Cisco/results/X410M8_1_node_4S_GNR_86C/whisper/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3","","closed","0","v6.1","0","False","Samples/s","INT8","None","" "CoreWeave","available","closed","datacenter","CoreWeave B200 SXM (8x B200-SXM-180GB)","B200-SXM-180GBx8_TRT","deepseek-r1","deepseek-r1","Offline","58913.2","exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3888.048541476755","1","Intel(R) Xeon(R) Platinum 8562Y+","2","32","NVIDIA B200-SXM-180GB","8","8","./closed/CoreWeave/results/B200-SXM-180GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B200 SXM (8x B200-SXM-180GB)","B200-SXM-180GBx8_TRT","deepseek-r1","deepseek-r1","Server","56121.3","exact_match: 81.60893345487693 TOKENS_PER_SAMPLE: 3816.3475387420235","1","Intel(R) Xeon(R) Platinum 8562Y+","2","32","NVIDIA B200-SXM-180GB","8","8","./closed/CoreWeave/results/B200-SXM-180GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B200 SXM (8x B200-SXM-180GB)","B200-SXM-180GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","91487.4","exact_match: 83.901","1","Intel(R) Xeon(R) Platinum 8562Y+","2","32","NVIDIA B200-SXM-180GB","8","8","./closed/CoreWeave/results/B200-SXM-180GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B200 SXM (8x B200-SXM-180GB)","B200-SXM-180GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","90204.7","exact_match: 83.728","1","Intel(R) Xeon(R) Platinum 8562Y+","2","32","NVIDIA B200-SXM-180GB","8","8","./closed/CoreWeave/results/B200-SXM-180GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B200 SXM (8x B200-SXM-180GB)","B200-SXM-180GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","102703.0","ROUGE1: 44.833 ROUGE2: 22.4096 ROUGEL: 29.2097 TOKENS_PER_SAMPLE: 271.6","1","Intel(R) Xeon(R) Platinum 8562Y+","2","32","NVIDIA B200-SXM-180GB","8","8","./closed/CoreWeave/results/B200-SXM-180GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B200 SXM (8x B200-SXM-180GB)","B200-SXM-180GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","102398.0","ROUGE1: 44.8305 ROUGE2: 22.4096 ROUGEL: 29.21 TOKENS_PER_SAMPLE: 271.5","1","Intel(R) Xeon(R) Platinum 8562Y+","2","32","NVIDIA B200-SXM-180GB","8","8","./closed/CoreWeave/results/B200-SXM-180GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B300 SXM (8x B300-SXM-270GB)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","112840.0","exact_match: 83.290","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/CoreWeave/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B300 SXM (8x B300-SXM-270GB)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","111247.0","exact_match: 83.467","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/CoreWeave/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B300 SXM (8x B300-SXM-270GB)","B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","115530.0","ROUGE1: 44.7888 ROUGE2: 22.3737 ROUGEL: 29.1521 TOKENS_PER_SAMPLE: 272.9","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/CoreWeave/results/B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave B300 SXM (8x B300-SXM-270GB)","B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","114576.0","ROUGE1: 44.8422 ROUGE2: 22.4119 ROUGEL: 29.1975 TOKENS_PER_SAMPLE: 272.8","1","Intel(R) Xeon(R) 6747P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/CoreWeave/results/B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Offline","529991.0","exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3815.436645396536","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB200","4","72","./closed/CoreWeave/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","GB200 TGP 1200W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Server","419778.0","exact_match: 81.03919781221514 TOKENS_PER_SAMPLE: 3802.557201458523","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB200","4","72","./closed/CoreWeave/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","GB200 TGP 1200W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Offline","911566.0","exact_match: 83.394","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB200","4","72","./closed/CoreWeave/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","GB200 TGP 1200W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Server","901058.0","exact_match: 83.424","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB200","4","72","./closed/CoreWeave/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","GB200 TGP 1200W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","894002.0","ROUGE1: 44.8296 ROUGE2: 22.4099 ROUGEL: 29.2105 TOKENS_PER_SAMPLE: 271.5","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB200","4","72","./closed/CoreWeave/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","GB200 TGP 1200W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","910621.0","ROUGE1: 44.8247 ROUGE2: 22.3971 ROUGEL: 29.2015 TOKENS_PER_SAMPLE: 271.7","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB200","4","72","./closed/CoreWeave/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","GB200 TGP 1200W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (4x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","qwen3-vl-235b-a22b","VLM","Offline","72.59800294104302","0.7873886028433235","1","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","4","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","vLLM CentML:mlperf-inf-mm-q3vl-v6.0, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","Single 4-GPU GB300 node, TGP 1400W per GPU","closed","0","v6.1","1","False","Samples/s","fp4 weights, fp8 KV cache","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (4x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","qwen3-vl-235b-a22b","VLM","Server","64.13202030676248","0.7880294101448477","1","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","4","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","vLLM CentML:mlperf-inf-mm-q3vl-v6.0, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0","Ubuntu 24.04","Single 4-GPU GB300 node, TGP 1400W per GPU","closed","0","v6.1","1","False","Queries/s","fp4 weights, fp8 KV cache","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Offline","1197710.0","exact_match: 83.098","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","72","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","GB300 TGP 1400W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Server","1160490.0","exact_match: 82.875","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","72","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","GB300 TGP 1400W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","1136100.0","ROUGE1: 44.8147 ROUGE2: 22.3736 ROUGEL: 29.189 TOKENS_PER_SAMPLE: 272.4","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","72","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","GB300 TGP 1400W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","944902.0","ROUGE1: 44.8524 ROUGE2: 22.4096 ROUGEL: 29.218 TOKENS_PER_SAMPLE: 272.3","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","72","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","GB300 TGP 1400W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Offline","1135.2500157943905","0.78717027204421","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","72","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","GB300 TGP 1400W","closed","0","v6.1","1","False","Samples/s","fp4 weights, fp8 KV cache","None","" "CoreWeave","available","closed","datacenter","CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Server","1195.5907586337776","0.7875410543420632","18","NVIDIA Grace (Neoverse-V2)","2","72","NVIDIA GB300","4","72","./closed/CoreWeave/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","GB300 TGP 1400W","closed","0","v6.1","1","False","Queries/s","fp4 weights, fp8 KV cache","None","" "Crusoe","available","closed","datacenter","Crusoe Cloud 64x8 MI355X (512 GPU) — DeepSeek-R1 / SGLang","512xMI355X_Crusoe_DS","deepseek-r1","deepseek-r1","Offline","2901950.0","exact_match: 80.69735642661804 TOKENS_PER_SAMPLE: 3898.373746581586","64","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","512","./closed/Crusoe/results/512xMI355X_Crusoe_DS/deepseek-r1/Offline/performance/run_1","SGLang 0.5.15.post1 (ROCm 7.2.0), PyTorch 2.x","Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.0 userspace)","Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU DeepSeek-R1 (Offline + Server).. AMD MLPerf Inference v6.1 DeepSeek-R1 harness (SGLang backend). Model amd/Deepseek-S3_sq_a05_v2_mlperf6_1 — MXFP4 experts / FP8 KV cache / BF16 MLA-absorb. Per node TP8 / EP8 / DP-attention8 / PP1 (one 8-GPU replica); device_count=512. Server uses engine warmup (dsr_code6_1 WarmUp.ENCODED_SAMPLES) + prefill-delayer for TTFT/TPOT.","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Crusoe","available","closed","datacenter","Crusoe Cloud 64x8 MI355X (512 GPU) — DeepSeek-R1 / SGLang","512xMI355X_Crusoe_DS","deepseek-r1","deepseek-r1","Server","2405310.0","exact_match: 80.69735642661804 TOKENS_PER_SAMPLE: 3898.373746581586","64","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","512","./closed/Crusoe/results/512xMI355X_Crusoe_DS/deepseek-r1/Server/performance/run_1","SGLang 0.5.15.post1 (ROCm 7.2.0), PyTorch 2.x","Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.0 userspace)","Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU DeepSeek-R1 (Offline + Server).. AMD MLPerf Inference v6.1 DeepSeek-R1 harness (SGLang backend). Model amd/Deepseek-S3_sq_a05_v2_mlperf6_1 — MXFP4 experts / FP8 KV cache / BF16 MLA-absorb. Per node TP8 / EP8 / DP-attention8 / PP1 (one 8-GPU replica); device_count=512. Server uses engine warmup (dsr_code6_1 WarmUp.ENCODED_SAMPLES) + prefill-delayer for TTFT/TPOT.","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Crusoe","available","closed","datacenter","Crusoe Cloud 64x8 MI355X (512 GPU) — gpt-oss-120b / vLLM","512xMI355X_Crusoe_GPT","gpt-oss-120b","gpt-oss-120b","Offline","5749440.0","exact_match: 83.706","64","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","512","./closed/Crusoe/results/512xMI355X_Crusoe_GPT/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.1 (ROCm 7.2.2), PyTorch 2.10","Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.2 userspace)","Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU gpt-oss-120b (Offline + Server).. AMD MLPerf Inference v6.1 gpt-oss-120b harness (vLLM backend). Native-MXFP4 model openai/gpt-oss-120b@b5c939d (NOT the v6.0 Quark repack). tensor_parallel_size=1 (one GPU per replica, 8 replicas/node); device_count=512. Dedicated ZMQ head dispatches Offline sample-ranges / Server per-query and relays token streams.","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "Crusoe","available","closed","datacenter","Crusoe Cloud 64x8 MI355X (512 GPU) — gpt-oss-120b / vLLM","512xMI355X_Crusoe_GPT","gpt-oss-120b","gpt-oss-120b","Server","5392930.0","exact_match: 83.706","64","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","512","./closed/Crusoe/results/512xMI355X_Crusoe_GPT/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.1 (ROCm 7.2.2), PyTorch 2.10","Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.2 userspace)","Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU gpt-oss-120b (Offline + Server).. AMD MLPerf Inference v6.1 gpt-oss-120b harness (vLLM backend). Native-MXFP4 model openai/gpt-oss-120b@b5c939d (NOT the v6.0 Quark repack). tensor_parallel_size=1 (one GPU per replica, 8 replicas/node); device_count=512. Dedicated ZMQ head dispatches Offline sample-ranges / Server per-query and relays token streams.","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (16x GB200-186GB_aarch64, Dynamo)","GB200-NVL72_GB200-186GB_aarch64x16_Dynamo","qwen3-vl-235b-a22b","VLM","Interactive","39.85079133425917","0.7860671731639475","4","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","16","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x16_Dynamo/qwen3-vl-235b-a22b/Interactive/performance/run_1","NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","NVFP4, FP8 (KV cache)","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (16x GB200-186GB_aarch64, Dynamo)","GB200-NVL72_GB200-186GB_aarch64x16_Dynamo","qwen3-vl-235b-a22b","VLM","Offline","230.088792881784","0.7880099213678822","4","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","16","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x16_Dynamo/qwen3-vl-235b-a22b/Offline/performance/run_1","NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","NVFP4, FP8 (KV cache)","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (16x GB200-186GB_aarch64, Dynamo)","GB200-NVL72_GB200-186GB_aarch64x16_Dynamo","qwen3-vl-235b-a22b","VLM","Server","198.9444574056901","0.7881503918126641","4","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","16","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x16_Dynamo/qwen3-vl-235b-a22b/Server/performance/run_1","NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","NVFP4, FP8 (KV cache)","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, Dynamo)","GB200-NVL72_GB200-186GB_aarch64x4_Dynamo","qwen3-vl-235b-a22b","VLM","Interactive","3.9940567447504782","0.785571974099286","1","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","4","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x4_Dynamo/qwen3-vl-235b-a22b/Interactive/performance/run_1","NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","NVFP4, FP8 (KV cache)","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, Dynamo)","GB200-NVL72_GB200-186GB_aarch64x4_Dynamo","qwen3-vl-235b-a22b","VLM","Offline","58.395875238853066","0.7870702100264627","1","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","4","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x4_Dynamo/qwen3-vl-235b-a22b/Offline/performance/run_1","NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","NVFP4, FP8 (KV cache)","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, Dynamo)","GB200-NVL72_GB200-186GB_aarch64x4_Dynamo","qwen3-vl-235b-a22b","VLM","Server","49.6962883240102","0.7878435998292614","1","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","4","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x4_Dynamo/qwen3-vl-235b-a22b/Server/performance/run_1","NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","NVFP4, FP8 (KV cache)","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x4_TRT","gpt-oss-120b","gpt-oss-120b","Offline","50912.9","exact_match: 83.691","1","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","4","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x4_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Crusoe","available","closed","datacenter","NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x4_TRT","gpt-oss-120b","gpt-oss-120b","Server","50613.5","exact_match: 83.642","1","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","4","./closed/Crusoe/results/GB200-NVL72_GB200-186GB_aarch64x4_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","PowerEdge R770AP_128C 24x96GB (6400 MT/s)","1-node-2S-GNR_128C","rgat","rgat","Offline","21835.4","acc: 72.578","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Dell/results/1-node-2S-GNR_128C/rgat/Offline/performance/run_1","PyTorch","Ubuntu 22.04.5 LTS","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Dell","available","closed","datacenter","PowerEdge R770AP_128C 24x96GB (6400 MT/s)","1-node-2S-GNR_128C","whisper","whisper","Offline","2275.93","ACCURACY: 97.89143156192017","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Dell/results/1-node-2S-GNR_128C/whisper/Offline/performance/run_1","PyTorch","Ubuntu 22.04.5 LTS","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Dell","available","closed","datacenter","PowerEdge R770_86C 16x64GB (6400 MT/s)","1-node-2S-GNR_86C","llama3_1-8b","llama3.1-8b","Offline","1227.99","ROUGE1: 38.6229 ROUGE2: 15.8107 ROUGEL: 24.4082 ROUGELSUM: 35.6517 GEN_LEN: 8188478","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Dell/results/1-node-2S-GNR_86C/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 24.04 LTS","Dell PowerEdge R770. vLLM, FP8 KV Cache","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Dell","available","closed","datacenter","PowerEdge R770_86C 16x64GB (6400 MT/s)","1-node-2S-GNR_86C","llama3_1-8b","llama3.1-8b","Server","516.012","ROUGE1: 38.6453 ROUGE2: 15.8841 ROUGEL: 24.4777 ROUGELSUM: 35.7016 GEN_LEN: 8176464","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Dell/results/1-node-2S-GNR_86C/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 24.04 LTS","Dell PowerEdge R770. vLLM, FP8 KV Cache","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Dell","available","closed","datacenter","PowerEdge R770_86C 16x64GB (6400 MT/s)","1-node-2S-GNR_86C","rgat","rgat","Offline","16042.8","acc: 72.570","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Dell/results/1-node-2S-GNR_86C/rgat/Offline/performance/run_1","PyTorch","Ubuntu 24.04 LTS","Dell PowerEdge R770. vLLM, FP8 KV Cache","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Dell","available","closed","datacenter","PowerEdge R770_86C 16x64GB (6400 MT/s)","1-node-2S-GNR_86C","whisper","whisper","Offline","1539.49","ACCURACY: 97.89904372234645","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Dell/results/1-node-2S-GNR_86C/whisper/Offline/performance/run_1","PyTorch","Ubuntu 24.04 LTS","Dell PowerEdge R770. vLLM, FP8 KV Cache","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Dell","available","closed","edge","Dell Pro Max (1x GB10)","Dell_Pro_Max_GB10x1","yolo-95","yolo-95","multistream","105.162072","mAP: 53.113","1","Cortex-X925","20","1","NVIDIA GB10","1","1","./closed/Dell/results/Dell_Pro_Max_GB10x1/yolo-95/multistream/performance/run_1","CUDA 13.0","Ubuntu 24.04.3 LTS","Dell Pro Max with GB10","closed","0","v6.1","1","False","Latency (ms)","fp4","None","" "Dell","available","closed","edge","Dell Pro Max (1x GB10)","Dell_Pro_Max_GB10x1","yolo-95","yolo-95","offline","78.7257","mAP: 53.113","1","Cortex-X925","20","1","NVIDIA GB10","1","1","./closed/Dell/results/Dell_Pro_Max_GB10x1/yolo-95/offline/performance/run_1","CUDA 13.0","Ubuntu 24.04.3 LTS","Dell Pro Max with GB10","closed","0","v6.1","1","False","Samples/s","fp4","None","" "Dell","available","closed","edge","Dell Pro Max (1x GB10)","Dell_Pro_Max_GB10x1","yolo-95","yolo-95","singlestream","13.865536","mAP: 53.113","1","Cortex-X925","20","1","NVIDIA GB10","1","1","./closed/Dell/results/Dell_Pro_Max_GB10x1/yolo-95/singlestream/performance/run_1","CUDA 13.0","Ubuntu 24.04.3 LTS","Dell Pro Max with GB10","closed","0","v6.1","1","False","Latency (ms)","fp4","None","" "Dell","available","closed","edge","Dell Pro Max (1x GB10)","Dell_Pro_Max_GB10x1","yolo-99","yolo-99","multistream","105.162072","mAP: 53.113","1","Cortex-X925","20","1","NVIDIA GB10","1","1","./closed/Dell/results/Dell_Pro_Max_GB10x1/yolo-99/multistream/performance/run_1","CUDA 13.0","Ubuntu 24.04.3 LTS","Dell Pro Max with GB10","closed","0","v6.1","1","False","Latency (ms)","fp4","None","" "Dell","available","closed","edge","Dell Pro Max (1x GB10)","Dell_Pro_Max_GB10x1","yolo-99","yolo-99","offline","78.7257","mAP: 53.113","1","Cortex-X925","20","1","NVIDIA GB10","1","1","./closed/Dell/results/Dell_Pro_Max_GB10x1/yolo-99/offline/performance/run_1","CUDA 13.0","Ubuntu 24.04.3 LTS","Dell Pro Max with GB10","closed","0","v6.1","1","False","Samples/s","fp4","None","" "Dell","available","closed","edge","Dell Pro Max (1x GB10)","Dell_Pro_Max_GB10x1","yolo-99","yolo-99","singlestream","13.865536","mAP: 53.113","1","Cortex-X925","20","1","NVIDIA GB10","1","1","./closed/Dell/results/Dell_Pro_Max_GB10x1/yolo-99/singlestream/performance/run_1","CUDA 13.0","Ubuntu 24.04.3 LTS","Dell Pro Max with GB10","closed","0","v6.1","1","False","Latency (ms)","fp4","None","" "Dell","available","closed","datacenter","PowerEdge XE7740 (8x RTXPro6000-PCIe-96GB, TensorRT)","XE7740_RTXPro6000_PCIe_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","29796.7","ROUGE1: 44.7408 ROUGE2: 22.3357 ROUGEL: 29.1354 TOKENS_PER_SAMPLE: 274.4","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Dell/results/XE7740_RTXPro6000_PCIe_96GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","PowerEdge XE7740 (8x RTXPro6000-PCIe-96GB, TensorRT)","XE7740_RTXPro6000_PCIe_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","28973.3","ROUGE1: 44.6929 ROUGE2: 22.2906 ROUGEL: 29.0805 TOKENS_PER_SAMPLE: 267.3","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Dell/results/XE7740_RTXPro6000_PCIe_96GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","PowerEdge XE7745 (8x NVIDIA RTX PRO 4500 Blackwell, TensorRT)","XE7745_RTXPRO4500_32GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","4374.06","ROUGE1: 44.7919 ROUGE2: 22.3659 ROUGEL: 29.1627 TOKENS_PER_SAMPLE: 273.2","1","AMD EPYC 9655","1","96","NVIDIA RTX PRO 4500 Blackwell","8","8","./closed/Dell/results/XE7745_RTXPRO4500_32GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.3","Ubuntu 24.04.3","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","PowerEdge XE7745 (8x NVIDIA RTX PRO 4500 Blackwell, TensorRT)","XE7745_RTXPRO4500_32GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","3012.33","ROUGE1: 44.7861 ROUGE2: 22.3547 ROUGEL: 29.1687 TOKENS_PER_SAMPLE: 271.3","1","AMD EPYC 9655","1","96","NVIDIA RTX PRO 4500 Blackwell","8","8","./closed/Dell/results/XE7745_RTXPRO4500_32GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.3","Ubuntu 24.04.3","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","Dell PowerEdge XE9712","XE9712x18","wan-2.2-t2v-a14b","text_to_video","Offline","0.6455254875195523","0.7009552217488585","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Dell/results/XE9712x18/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","fp8","None","" "Dell","available","closed","datacenter","Dell PowerEdge XE9712","XE9712x18","wan-2.2-t2v-a14b","text_to_video","SingleStream","10.585000540652779","0.6970976320484682","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Dell/results/XE9712x18/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "Dell","available","closed","datacenter","Dell XE9780 (8x B300-SXM-270GB, TensorRT)","XE9780-B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","109257.0","exact_match: 83.610","1","Intel(R) Xeon(R) 6747P","2","96","Nvidia B300-SXM-270GB","8","8","./closed/Dell/results/XE9780-B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","Dell XE9780 (8x B300-SXM-270GB, TensorRT)","XE9780-B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","103332.0","exact_match: 83.460","1","Intel(R) Xeon(R) 6747P","2","96","Nvidia B300-SXM-270GB","8","8","./closed/Dell/results/XE9780-B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","Dell XE9780 (8x B300-SXM-270GB, TensorRT)","XE9780-B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","104006.0","ROUGE1: 44.9129 ROUGE2: 22.4979 ROUGEL: 29.3269 TOKENS_PER_SAMPLE: 271.0","1","Intel(R) Xeon(R) 6747P","2","96","Nvidia B300-SXM-270GB","8","8","./closed/Dell/results/XE9780-B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","Dell XE9780 (8x B300-SXM-270GB, TensorRT)","XE9780-B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","96180.6","ROUGE1: 44.8204 ROUGE2: 22.399 ROUGEL: 29.2127 TOKENS_PER_SAMPLE: 272.0","1","Intel(R) Xeon(R) 6747P","2","96","Nvidia B300-SXM-270GB","8","8","./closed/Dell/results/XE9780-B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","gpt-oss-120b","gpt-oss-120b","Offline","117804.0","exact_match: 84.217","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","gpt-oss-120b","gpt-oss-120b","Server","110188.0","exact_match: 83.843","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","llama2-70b-99.9","llama2-70b-99.9","Interactive","73238.1","ROUGE1: 44.4905 ROUGE2: 22.144 ROUGEL: 28.908 TOKENS_PER_SAMPLE: 284.4","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/llama2-70b-99.9/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","llama2-70b-99.9","llama2-70b-99.9","Offline","103792.0","ROUGE1: 44.5322 ROUGE2: 22.1855 ROUGEL: 28.9228 TOKENS_PER_SAMPLE: 284.4","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/llama2-70b-99.9/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","llama2-70b-99.9","llama2-70b-99.9","Server","103932.0","ROUGE1: 44.5341 ROUGE2: 22.1716 ROUGEL: 28.9333 TOKENS_PER_SAMPLE: 284.0","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/llama2-70b-99.9/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","llama3.1-8b","llama3.1-8b","Interactive","130540.0","ROUGE1: 38.561 ROUGE2: 16.0262 ROUGEL: 24.4382 ROUGELSUM: 35.6995 GEN_LEN: 8150427","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/llama3.1-8b/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","llama3.1-8b","llama3.1-8b","Offline","158458.0","ROUGE1: 38.5617 ROUGE2: 16.0263 ROUGEL: 24.4381 ROUGELSUM: 35.6994 GEN_LEN: 8151245","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/llama3.1-8b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell","available","closed","datacenter","XE9785L_8xMI355X","XE9785L_8xMI355X","llama3.1-8b","llama3.1-8b","Server","148563.0","ROUGE1: 38.5211 ROUGE2: 16.0095 ROUGEL: 24.4208 ROUGELSUM: 35.662 GEN_LEN: 8168331","1","AMD EPYC 9655","2","96","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell/results/XE9785L_8xMI355X/llama3.1-8b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell","available","closed","datacenter","Dell XE9785L (8x B300-SXM-270GB, TensorRT)","XE9785L_x86_B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","113101.0","ROUGE1: 44.8017 ROUGE2: 22.3823 ROUGEL: 29.1656 TOKENS_PER_SAMPLE: 272.7","1","AMD EPYC 9965","2","192","NVIDIA B300-SXM-270GB","8","8","./closed/Dell/results/XE9785L_x86_B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell","available","closed","datacenter","Dell XE9785L (8x B300-SXM-270GB, TensorRT)","XE9785L_x86_B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","106898.0","ROUGE1: 44.8186 ROUGE2: 22.3916 ROUGEL: 29.1862 TOKENS_PER_SAMPLE: 272.3","1","AMD EPYC 9965","2","192","NVIDIA B300-SXM-270GB","8","8","./closed/Dell/results/XE9785L_x86_B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","dlrm-v3","dlrm-v3","Offline","4837.63","DLRM_NE: 0.8677279311862482 DLRM_ACC: 0.6964196251791978 DLRM_AUC: 0.7862870079033047","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/dlrm-v3/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Samples/s","int8,bf16","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","dlrm-v3","dlrm-v3","Server","4503.53","DLRM_NE: 0.8677277210685596 DLRM_ACC: 0.6964198708391458 DLRM_AUC: 0.7862873761281074","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/dlrm-v3/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Queries/s","int8,bf16","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","gpt-oss-120b","gpt-oss-120b","Offline","48971.1","exact_match: 83.287","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","gpt-oss-120b","gpt-oss-120b","Server","40867.9","exact_match: 83.631","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","llama2-70b-99.9","llama2-70b-99.9","Interactive","22860.5","ROUGE1: 44.4031 ROUGE2: 22.0641 ROUGEL: 28.8533 TOKENS_PER_SAMPLE: 288.3","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/llama2-70b-99.9/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","llama2-70b-99.9","llama2-70b-99.9","Offline","42286.2","ROUGE1: 44.5012 ROUGE2: 22.1742 ROUGEL: 28.9465 TOKENS_PER_SAMPLE: 284.2","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/llama2-70b-99.9/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","llama2-70b-99.9","llama2-70b-99.9","Server","41830.0","ROUGE1: 44.4477 ROUGE2: 22.0889 ROUGEL: 28.8674 TOKENS_PER_SAMPLE: 287.4","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/llama2-70b-99.9/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","llama3.1-8b","llama3.1-8b","Interactive","62723.7","ROUGE1: 38.5629 ROUGE2: 16.0233 ROUGEL: 24.4351 ROUGELSUM: 35.6984 GEN_LEN: 8150299","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/llama3.1-8b/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","llama3.1-8b","llama3.1-8b","Offline","73643.0","ROUGE1: 38.5604 ROUGE2: 16.0125 ROUGEL: 24.4415 ROUGELSUM: 35.6907 GEN_LEN: 8149596","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/llama3.1-8b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","llama3.1-8b","llama3.1-8b","Server","72305.1","ROUGE1: 38.5633 ROUGE2: 16.0282 ROUGEL: 24.4369 ROUGELSUM: 35.7015 GEN_LEN: 8151565","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/llama3.1-8b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","wan-2.2-t2v-a14b","text_to_video","Offline","0.0345875","vbench_score: 69.9361","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/wan-2.2-t2v-a14b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Samples/s","bf16, fp8, fp4","None","" "Dell_AMD","available","closed","datacenter","XE7745_8xMI350P_2xEPYC_9455","XE7745_8xMI350P_2xEPYC-9455","wan-2.2-t2v-a14b","text_to_video","SingleStream","41.837923108000005","vbench_score: 70.3648","1","AMD EPYC 9455","2","48","AMD Instinct MI350P","8","8","./closed/Dell_AMD/results/XE7745_8xMI350P_2xEPYC-9455/wan-2.2-t2v-a14b/SingleStream/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)","8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Latency (s)","bf16, fp8, fp4","None","" "Dell_MangoBoost","available","closed","datacenter","Heterogeneous Four-Cluster (2x8x MI300X + 2x8x MI355X, LLMBoost)","2x8xMI355X_2x8xMI300X","gpt-oss-120b","gpt-oss-120b","Offline","285454.0","exact_match: 84.250","4","AMD EPYC 9534 (on MI300X node) and AMD EPYC 9965 (on MI355X node)","2","64(AMD EPYC 9534) and 192(AMD EPYC 9965)","AMD Instinct MI300X 192GB HBM3 (x2x8) and AMD Instinct MI355X 288GB HBM3e (x2x8)","8","32","./closed/Dell_MangoBoost/results/2x8xMI355X_2x8xMI300X/gpt-oss-120b/Offline/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Heterogeneous Four-Cluster with LLMBoost, vLLM 0.22.1 on MI355X, and vLLM 0.24.0 on MI300X","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell_MangoBoost","available","closed","datacenter","Heterogeneous Four-Cluster (2x8x MI300X + 2x8x MI355X, LLMBoost)","2x8xMI355X_2x8xMI300X","gpt-oss-120b","gpt-oss-120b","Server","253501.0","exact_match: 83.574","4","AMD EPYC 9534 (on MI300X node) and AMD EPYC 9965 (on MI355X node)","2","64(AMD EPYC 9534) and 192(AMD EPYC 9965)","AMD Instinct MI300X 192GB HBM3 (x2x8) and AMD Instinct MI355X 288GB HBM3e (x2x8)","8","32","./closed/Dell_MangoBoost/results/2x8xMI355X_2x8xMI300X/gpt-oss-120b/Server/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Heterogeneous Four-Cluster with LLMBoost, vLLM 0.22.1 on MI355X, and vLLM 0.24.0 on MI300X","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell_MangoBoost","available","closed","datacenter","PowerEdge XE9785","XE9785","gpt-oss-120b","gpt-oss-120b","Interactive","28265.9","exact_match: 83.676","1","AMD EPYC 9965","2","192","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell_MangoBoost/results/XE9785/gpt-oss-120b/Interactive/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Intra-Node P/D Disaggregation for Interactive Scenario, and vLLM 0.22.1","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "Dell_MangoBoost","available","closed","datacenter","PowerEdge XE9785","XE9785","gpt-oss-120b","gpt-oss-120b","Offline","115294.0","exact_match: 83.720","1","AMD EPYC 9965","2","192","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell_MangoBoost/results/XE9785/gpt-oss-120b/Offline/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Intra-Node P/D Disaggregation for Interactive Scenario, and vLLM 0.22.1","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell_MangoBoost","available","closed","datacenter","PowerEdge XE9785","XE9785","gpt-oss-120b","gpt-oss-120b","Server","109065.0","exact_match: 83.806","1","AMD EPYC 9965","2","192","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell_MangoBoost/results/XE9785/gpt-oss-120b/Server/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Intra-Node P/D Disaggregation for Interactive Scenario, and vLLM 0.22.1","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell_MangoBoost","available","closed","datacenter","PowerEdge XE9785L","XE9785L","gpt-oss-120b","gpt-oss-120b","Interactive","29585.5","exact_match: 84.127","1","AMD EPYC 9965","2","192","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell_MangoBoost/results/XE9785L/gpt-oss-120b/Interactive/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Intra-Node P/D Disaggregation for Interactive Scenario, and vLLM 0.22.1","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "Dell_MangoBoost","available","closed","datacenter","PowerEdge XE9785L","XE9785L","gpt-oss-120b","gpt-oss-120b","Offline","116953.0","exact_match: 83.643","1","AMD EPYC 9965","2","192","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell_MangoBoost/results/XE9785L/gpt-oss-120b/Offline/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Intra-Node P/D Disaggregation for Interactive Scenario, and vLLM 0.22.1","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Dell_MangoBoost","available","closed","datacenter","PowerEdge XE9785L","XE9785L","gpt-oss-120b","gpt-oss-120b","Server","110153.0","exact_match: 83.598","1","AMD EPYC 9965","2","192","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Dell_MangoBoost/results/XE9785L/gpt-oss-120b/Server/performance/run_1","ROCm","Ubuntu 22.04.5 LTS (jammy)","Intra-Node P/D Disaggregation for Interactive Scenario, and vLLM 0.22.1","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Fujitsu","available","closed","datacenter","PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8, TensorRT)","PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","26626.5","ROUGE1: 44.7182 ROUGE2: 22.3154 ROUGEL: 29.104 TOKENS_PER_SAMPLE: 273.6","1","Intel(R) Xeon(R) Platinum 8592+","2","64","NVIDIA RTX PRO 6000 Blackwell","8","8","./closed/Fujitsu/results/PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.16, CUDA 13.2, cuDNN 9.21","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Fujitsu","available","closed","datacenter","PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8, TensorRT)","PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","27340.9","ROUGE1: 44.7475 ROUGE2: 22.3697 ROUGEL: 29.1476 TOKENS_PER_SAMPLE: 274.5","1","Intel(R) Xeon(R) Platinum 8592+","2","64","NVIDIA RTX PRO 6000 Blackwell","8","8","./closed/Fujitsu/results/PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.16, CUDA 13.2, cuDNN 9.21","Ubuntu 24.04","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","72445.1","exact_match: 81.24430264357338 TOKENS_PER_SAMPLE: 3793.010711030082","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","70495.7","exact_match: 81.26709206927985 TOKENS_PER_SAMPLE: 3788.4774384685506","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","111625.0","exact_match: 83.316","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","111218.0","exact_match: 83.071","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","115034.0","ROUGE1: 44.803 ROUGE2: 22.3802 ROUGEL: 29.1563 TOKENS_PER_SAMPLE: 272.6","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","114832.0","ROUGE1: 44.8381 ROUGE2: 22.394 ROUGEL: 29.1852 TOKENS_PER_SAMPLE: 272.5","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Interactive","12.485432132404888","0.7879417016152472","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","nvfp4, fp8-kv","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Offline","131.2852847183584","0.7870700970178708","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","nvfp4, fp8-kv","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Server","111.7532977914224","0.7880503014737441","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","nvfp4, fp8-kv","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.06291526723554443","0.7028431480110648","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","fp8","None","" "GigaComputing","available","closed","datacenter","G894-AD3-AAX7","G894-AD3-AAX7_B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","19.079404388444445","0.7036278864900404","1","Intel(R) Xeon(R) 6979P","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-AD3-AAX7_B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","72327.1","exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3803.4314038286234","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","70771.7","exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3851.8625797629898","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","111541.0","exact_match: 82.928","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","110592.0","exact_match: 83.965","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","114826.0","ROUGE1: 44.8002 ROUGE2: 22.3763 ROUGEL: 29.1593 TOKENS_PER_SAMPLE: 272.5","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","114578.0","ROUGE1: 44.8817 ROUGE2: 22.4296 ROUGEL: 29.2316 TOKENS_PER_SAMPLE: 271.9","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Interactive","12.881779740805642","0.787262910148138","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","NVFP4 weights with FP8 KV cache","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Offline","132.0547880616454","0.7875530423168103","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","NVFP4 weights with FP8 KV cache","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Server","115.78393993840092","0.7880234463575065","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","NVFP4 weights with FP8 KV cache","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.0625123079679506","0.7048583781540092","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","fp8","None","" "GigaComputing","available","closed","datacenter","G894-ZD3-AAX7","G894-ZD3-AAX7_B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","18.051798671840277","0.6987459561814395","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/GigaComputing/results/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 22.04.4","B300 TGP 1100W","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "Google","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Interactive","232160.0","exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3809.1959890610756","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/Google/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Interactive/performance/run_1","PyTorch 2.10.0a0+b4e4ee81d3.nv25.12, TensorRT 10.14.1.48, CUDA Toolkit 13.1, cuDNN 9.17.0, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU. DeepSeek-R1 used the pinned aarch64 MLPerf TensorRT-LLM container. Runtime logs show MNNVL/NVLinkOneSided selection for Offline, Server, and Interactive; colocated Offline/Server also initialized the NIXL UCX backend, while disaggregated Interactive used a UCX KV-cache transceiver between context and generation services.","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Google","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Offline","510781.0","exact_match: 81.19872379216044 TOKENS_PER_SAMPLE: 3852.355970829535","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/Google/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Offline/performance/run_1","PyTorch 2.10.0a0+b4e4ee81d3.nv25.12, TensorRT 10.14.1.48, CUDA Toolkit 13.1, cuDNN 9.17.0, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU. DeepSeek-R1 used the pinned aarch64 MLPerf TensorRT-LLM container. Runtime logs show MNNVL/NVLinkOneSided selection for Offline, Server, and Interactive; colocated Offline/Server also initialized the NIXL UCX backend, while disaggregated Interactive used a UCX KV-cache transceiver between context and generation services.","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Google","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Server","388590.0","exact_match: 81.01640838650866 TOKENS_PER_SAMPLE: 3795.0934366453967","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/Google/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Server/performance/run_1","PyTorch 2.10.0a0+b4e4ee81d3.nv25.12, TensorRT 10.14.1.48, CUDA Toolkit 13.1, cuDNN 9.17.0, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU. DeepSeek-R1 used the pinned aarch64 MLPerf TensorRT-LLM container. Runtime logs show MNNVL/NVLinkOneSided selection for Offline, Server, and Interactive; colocated Offline/Server also initialized the NIXL UCX backend, while disaggregated Interactive used a UCX KV-cache transceiver between context and generation services.","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","NVIDIA GB200 NVL72 by HPE (8x GB200-186GB_aarch64, TensorRT)","HPE_GB200-NVL72_GB200-186GB_aarch64x8","gpt-oss-120b","gpt-oss-120b","Offline","101453.0","exact_match: 83.727","2","NVIDIA Grace CPU (Arm Neoverse-V2)","2","144","NVIDIA GB200","4","8","./closed/HPE/results/HPE_GB200-NVL72_GB200-186GB_aarch64x8/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k","NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Two dep8 replicas across two nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","NVIDIA GB200 NVL72 by HPE (8x GB200-186GB_aarch64, TensorRT)","HPE_GB200-NVL72_GB200-186GB_aarch64x8","gpt-oss-120b","gpt-oss-120b","Server","100714.0","exact_match: 83.485","2","NVIDIA Grace CPU (Arm Neoverse-V2)","2","144","NVIDIA GB200","4","8","./closed/HPE/results/HPE_GB200-NVL72_GB200-186GB_aarch64x8/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k","NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Two dep8 replicas across two nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","edge","HPE ProLiant DL145 Gen11 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)","HPE_PROLIANT_DL145_RTX_PRO_4500_PCIE_32GBx1","qwen3.6-27b","agentic edge","SingleStream","2757.954404037736","0.8613065326633166","1","AMD EPYC 8535P","1","64","NVIDIA RTX PRO 4500 Blackwell Server Edition","1","1","./closed/HPE/results/HPE_PROLIANT_DL145_RTX_PRO_4500_PCIE_32GBx1/qwen3.6-27b/SingleStream/performance/run_1","llama.cpp","Ubuntu 24.04.3","","closed","0","v6.1","1","False","Latency (ms)","int4","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL345 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)","HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1","yolo-95","yolo-95","multistream","676.268814","mAP: 53.114","1","AMD EPYC 9375F","1","32","NVIDIA RTX PRO 4500 Blackwell Server Edition","1","1","./closed/HPE/results/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1/yolo-95/multistream/performance/run_1","PyTorch v2.13.0","Ubuntu 24.04.4","","closed","0","v6.1","1","False","Latency (ms)","fp32","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL345 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)","HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1","yolo-95","yolo-95","offline","146.207","mAP: 53.109","1","AMD EPYC 9375F","1","32","NVIDIA RTX PRO 4500 Blackwell Server Edition","1","1","./closed/HPE/results/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1/yolo-95/offline/performance/run_1","PyTorch v2.13.0","Ubuntu 24.04.4","","closed","0","v6.1","1","False","Samples/s","fp32","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL345 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)","HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1","yolo-95","yolo-95","singlestream","76.664039","mAP: 53.114","1","AMD EPYC 9375F","1","32","NVIDIA RTX PRO 4500 Blackwell Server Edition","1","1","./closed/HPE/results/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1/yolo-95/singlestream/performance/run_1","PyTorch v2.13.0","Ubuntu 24.04.4","","closed","0","v6.1","1","False","Latency (ms)","fp32","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT","HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_AGENTIC","qwen3.6-27b","agentic edge","SingleStream","2616.1590054885796","0.864321608040201","1","AMD EPYC 9375F","1","32","NVIDIA RTX PRO 4500 Blackwell Server Edition","4","4","./closed/HPE/results/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_AGENTIC/qwen3.6-27b/SingleStream/performance/run_1","llama.cpp","Ubuntu 24.04.4","","closed","0","v6.1","1","False","Latency (ms)","int4","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT","HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT","whisper","whisper","Offline","3685.7","ACCURACY: 97.84824462061155","1","AMD EPYC 9375F","1","32","NVIDIA RTX PRO 4500 Blackwell Server Edition","4","4","./closed/HPE/results/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT/whisper/Offline/performance/run_1","TensorRT 10.15.1.29, CUDA 13.2","Ubuntu 24.04.4","","closed","0","v6.1","0","False","Samples/s","fp16","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","gpt-oss-120b","gpt-oss-120b","Offline","15256.0","exact_match: 82.714","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","gpt-oss-120b","gpt-oss-120b","Server","14581.7","exact_match: 82.341","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/gpt-oss-120b/Server/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","llama2-70b-99.9","llama2-70b-99.9","Offline","29284.8","ROUGE1: 44.7216 ROUGE2: 22.3081 ROUGEL: 29.0908 TOKENS_PER_SAMPLE: 274.8","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","llama2-70b-99.9","llama2-70b-99.9","Server","28643.3","ROUGE1: 44.7706 ROUGE2: 22.352 ROUGEL: 29.1377 TOKENS_PER_SAMPLE: 272.0","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","llama3.1-8b","llama3.1-8b","Interactive","39986.3","ROUGE1: 38.7645 ROUGE2: 16.0515 ROUGEL: 24.5586 ROUGELSUM: 35.6824 GEN_LEN: 8173226","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/llama3.1-8b/Interactive/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","llama3.1-8b","llama3.1-8b","Offline","50965.3","ROUGE1: 38.7974 ROUGE2: 16.0868 ROUGEL: 24.5879 ROUGELSUM: 35.7199 GEN_LEN: 8172782","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/llama3.1-8b/Offline/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","llama3.1-8b","llama3.1-8b","Server","49523.3","ROUGE1: 38.7821 ROUGE2: 16.0772 ROUGEL: 24.5857 ROUGELSUM: 35.7074 GEN_LEN: 8172428","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/llama3.1-8b/Server/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)","HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8","whisper","whisper","Offline","19278.3","ACCURACY: 97.88345689351618","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/HPE/results/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8/whisper/Offline/performance/run_1","TensorRT 10.16.1.11, CUDA 13.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Samples/s","fp4","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB)","HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT","yolo-95","yolo-95","multistream","116.101325","mAP: 53.112","1","Intel(R) Xeon(R) 6762P","2","64","NVIDIA RTX PRO 4500 Blackwell Server Edition","1","1","./closed/HPE/results/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT/yolo-95/multistream/performance/run_1","PyTorch v2.13.0","Ubuntu 24.04.3","","closed","0","v6.1","1","False","Latency (ms)","fp32","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB)","HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT","yolo-95","yolo-95","offline","72.1855","mAP: 53.112","1","Intel(R) Xeon(R) 6762P","2","64","NVIDIA RTX PRO 4500 Blackwell Server Edition","1","1","./closed/HPE/results/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT/yolo-95/offline/performance/run_1","PyTorch v2.13.0","Ubuntu 24.04.3","","closed","0","v6.1","1","False","Samples/s","fp32","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB)","HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT","yolo-95","yolo-95","singlestream","14.136709","mAP: 53.112","1","Intel(R) Xeon(R) 6762P","2","64","NVIDIA RTX PRO 4500 Blackwell Server Edition","1","1","./closed/HPE/results/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT/yolo-95/singlestream/performance/run_1","PyTorch v2.13.0","Ubuntu 24.04.3","","closed","0","v6.1","1","False","Latency (ms)","fp32","None","" "HPE","available","closed","edge","HPE ProLiant Compute DL380 Gen12 (5x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)","HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx5_TRT","whisper","whisper","Offline","4719.46","ACCURACY: 97.85585808502336","1","Intel(R) Xeon(R) 6762P","2","64","NVIDIA RTX PRO 4500 Blackwell Server Edition","5","5","./closed/HPE/results/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx5_TRT/whisper/Offline/performance/run_1","TensorRT 10.11.0.33, CUDA 13.2","Ubuntu 24.04.3","","closed","0","v6.1","0","False","Samples/s","fp16","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","gpt-oss-120b","gpt-oss-120b","Offline","117355.0","exact_match: 83.687","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","gpt-oss-120b","gpt-oss-120b","Server","108836.0","exact_match: 83.864","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","llama2-70b-99.9","llama2-70b-99.9","Interactive","72977.2","ROUGE1: 44.5152 ROUGE2: 22.1564 ROUGEL: 28.9213 TOKENS_PER_SAMPLE: 284.1","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/llama2-70b-99.9/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","llama2-70b-99.9","llama2-70b-99.9","Offline","102991.0","ROUGE1: 44.5406 ROUGE2: 22.1922 ROUGEL: 28.9322 TOKENS_PER_SAMPLE: 284.2","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/llama2-70b-99.9/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","llama2-70b-99.9","llama2-70b-99.9","Server","101979.0","ROUGE1: 44.5325 ROUGE2: 22.1714 ROUGEL: 28.9308 TOKENS_PER_SAMPLE: 284.1","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/llama2-70b-99.9/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","llama3.1-8b","llama3.1-8b","Interactive","130613.0","ROUGE1: 38.567 ROUGE2: 16.0282 ROUGEL: 24.4449 ROUGELSUM: 35.7031 GEN_LEN: 8150301","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/llama3.1-8b/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","llama3.1-8b","llama3.1-8b","Offline","157694.0","ROUGE1: 38.5626 ROUGE2: 16.0276 ROUGEL: 24.4431 ROUGELSUM: 35.699 GEN_LEN: 8151086","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/llama3.1-8b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","llama3.1-8b","llama3.1-8b","Server","148118.0","ROUGE1: 38.5316 ROUGE2: 16.0159 ROUGEL: 24.4259 ROUGELSUM: 35.6716 GEN_LEN: 8162750","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/llama3.1-8b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","wan-2.2-t2v-a14b","text_to_video","Offline","0.0707035","vbench_score: 70.1048","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/wan-2.2-t2v-a14b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Samples/s","bf16, fp8, fp4","None","" "HPE","available","closed","datacenter","HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)","HPE_XD685_MI355X_288GBx8_vLLM","wan-2.2-t2v-a14b","text_to_video","SingleStream","16.397060151","vbench_score: 70.3025","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/HPE/results/HPE_XD685_MI355X_288GBx8_vLLM/wan-2.2-t2v-a14b/SingleStream/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)","HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Latency (s)","bf16, fp8, fp4","None","" "HPE","available","closed","datacenter","HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)","HPE_XD690_B300_SXM_270GBx16_TRT","deepseek-r1","deepseek-r1","Offline","136854.0","exact_match: 81.24430264357338 TOKENS_PER_SAMPLE: 3826.166362807657","2","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","16","./closed/HPE/results/HPE_XD690_B300_SXM_270GBx16_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.2","RHEL 9.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)","HPE_XD690_B300_SXM_270GBx16_TRT","deepseek-r1","deepseek-r1","Server","80536.9","exact_match: 80.92525068368278 TOKENS_PER_SAMPLE: 3807.0186873290795","2","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","16","./closed/HPE/results/HPE_XD690_B300_SXM_270GBx16_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.2","RHEL 9.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)","HPE_XD690_B300_SXM_270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","114569.0","exact_match: 83.235","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/HPE/results/HPE_XD690_B300_SXM_270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.2","RHEL 9.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","closed","datacenter","HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)","HPE_XD690_B300_SXM_270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","113685.0","exact_match: 83.448","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/HPE/results/HPE_XD690_B300_SXM_270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.2","RHEL 9.4","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Intel","available","closed","datacenter","1-node-2S-GNR_128C","1-node-2S-GNR_128C","llama3_1-8b","llama3.1-8b","Offline","1916.74","ROUGE1: 38.6418 ROUGE2: 15.8693 ROUGEL: 24.4809 ROUGELSUM: 35.6703 GEN_LEN: 8194131","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Intel/results/1-node-2S-GNR_128C/llama3_1-8b/Offline/performance/run_1","PyTorch","CentOS Stream 9","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Intel","available","closed","datacenter","1-node-2S-GNR_128C","1-node-2S-GNR_128C","llama3_1-8b","llama3.1-8b","Server","1139.51","ROUGE1: 38.6681 ROUGE2: 15.9242 ROUGEL: 24.5144 ROUGELSUM: 35.7046 GEN_LEN: 8206137","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Intel/results/1-node-2S-GNR_128C/llama3_1-8b/Server/performance/run_1","PyTorch","CentOS Stream 9","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Intel","available","closed","datacenter","1-node-2S-GNR_128C","1-node-2S-GNR_128C","rgat","rgat","Offline","24573.7","acc: 72.541","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Intel/results/1-node-2S-GNR_128C/rgat/Offline/performance/run_1","PyTorch","CentOS Stream 9","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Intel","available","closed","datacenter","1-node-2S-GNR_128C","1-node-2S-GNR_128C","whisper","whisper","Offline","2319.02","ACCURACY: 97.89143156192017","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Intel/results/1-node-2S-GNR_128C/whisper/Offline/performance/run_1","PyTorch","CentOS Stream 9","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Intel","available","closed","datacenter","1-node-2S-Xeon_6787P","1-node-2S-Xeon_6787P","e2e-rag-db","end to end vector-database","Offline","22.6141","E2E_ACCURACY: 98.1952","1","Intel(R) Xeon(R) 6787P","2","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-2S-Xeon_6787P/e2e-rag-db/Offline/performance/run_1","vLLM 0.22.1rc1.dev189+ga55fccfc7.d20260604, PyTorch 2.11.0+cpu, FAISS 1.14.3","Ubuntu 24.04.4 LTS (kernel 7.0.0-28-generic)","e2e-rag-qna: gpt-oss-120b on 4x Intel Arc Pro B70 (TP=4); gpt-oss-20b grader, e5-base-v2 embedding and colbertv2.0 reranking on CPU. e2e-rag-db: CPU-only vector-database build, no accelerator used.. e2e-rag-qna: async multi-shot RAG pipeline with pinned CPU embedding/FAISS and reranking services. e2e-rag-db: vector DB built from the frozen docs.tar.gz Wikipedia corpus (2515 HTML pages).","closed","0","v6.1","0","False","Samples/s","fp32","None","" "Intel","available","closed","datacenter","1-node-2S-Xeon_6787P","1-node-2S-Xeon_6787P","e2e-rag-qna","end to end question-answering","Offline","0.464076","E2E_ACCURACY: 35.9223","1","Intel(R) Xeon(R) 6787P","2","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-2S-Xeon_6787P/e2e-rag-qna/Offline/performance/run_1","vLLM 0.22.1rc1.dev189+ga55fccfc7.d20260604, PyTorch 2.11.0+cpu, FAISS 1.14.3","Ubuntu 24.04.4 LTS (kernel 7.0.0-28-generic)","e2e-rag-qna: gpt-oss-120b on 4x Intel Arc Pro B70 (TP=4); gpt-oss-20b grader, e5-base-v2 embedding and colbertv2.0 reranking on CPU. e2e-rag-db: CPU-only vector-database build, no accelerator used.. e2e-rag-qna: async multi-shot RAG pipeline with pinned CPU embedding/FAISS and reranking services. e2e-rag-db: vector DB built from the frozen docs.tar.gz Wikipedia corpus (2515 HTML pages).","closed","0","v6.1","0","False","Tasks/s","mxfp4 (LLMs), fp32 (embedding/reranker)","None","" "Intel","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","gpt-oss-120b","gpt-oss-120b","Offline","1956.4","exact_match: 83.674","1","Intel(R) Xeon(R) 698X","1","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-4x-BMG-B70/gpt-oss-120b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","MXFP4","None","" "Intel","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","gpt-oss-120b","gpt-oss-120b","Server","1296.87","exact_match: 83.489","1","Intel(R) Xeon(R) 698X","1","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-4x-BMG-B70/gpt-oss-120b/Server/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","MXFP4","None","" "Intel","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama2-70b-99.9","llama2-70b-99.9","Offline","2464.98","ROUGE1: 44.5947 ROUGE2: 22.2074 ROUGEL: 28.8264 TOKENS_PER_SAMPLE: 290.8","1","Intel(R) Xeon(R) 698X","1","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-4x-BMG-B70/llama2-70b-99.9/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Intel","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama2-70b-99.9","llama2-70b-99.9","Server","1745.48","ROUGE1: 44.5937 ROUGE2: 22.2052 ROUGEL: 28.8276 TOKENS_PER_SAMPLE: 290.8","1","Intel(R) Xeon(R) 698X","1","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-4x-BMG-B70/llama2-70b-99.9/Server/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Intel","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama3_1-8b","llama3.1-8b","Offline","4613.28","ROUGE1: 38.843 ROUGE2: 16.0878 ROUGEL: 24.6429 ROUGELSUM: 35.9449 GEN_LEN: 8127480","1","Intel(R) Xeon(R) 698X","1","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-4x-BMG-B70/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Intel","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama3_1-8b","llama3.1-8b","Server","4173.25","ROUGE1: 38.8131 ROUGE2: 16.0827 ROUGEL: 24.6388 ROUGELSUM: 35.9153 GEN_LEN: 8126165","1","Intel(R) Xeon(R) 698X","1","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-4x-BMG-B70/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Intel","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","whisper","whisper","Offline","5539.77","ACCURACY: 97.45763518206644","1","Intel(R) Xeon(R) 698X","1","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Intel/results/1-node-4x-BMG-B70/whisper/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Inventec","available","closed","datacenter","Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)","P5800G7-B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","70269.6","exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3748.471741112124","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P5800G7-B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)","P5800G7-B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","57432.0","exact_match: 81.10756608933455 TOKENS_PER_SAMPLE: 3769.7967183226983","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P5800G7-B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)","P5800G7-B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","106280.0","exact_match: 83.856","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P5800G7-B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)","P5800G7-B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","100299.0","exact_match: 83.423","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P5800G7-B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)","P5800G7-B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","109933.0","ROUGE1: 44.7871 ROUGE2: 22.3677 ROUGEL: 29.1429 TOKENS_PER_SAMPLE: 272.9","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P5800G7-B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)","P5800G7-B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","106617.0","ROUGE1: 44.8264 ROUGE2: 22.3815 ROUGEL: 29.1549 TOKENS_PER_SAMPLE: 272.1","1","Intel(R) Xeon(R) 6787P","2","86","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P5800G7-B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)","P9000G7-B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","69062.2","exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3743.316089334549","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P9000G7-B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)","P9000G7-B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","57517.4","exact_match: 80.62898814949864 TOKENS_PER_SAMPLE: 3774.6118960802187","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P9000G7-B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)","P9000G7-B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","105617.0","exact_match: 83.550","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P9000G7-B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)","P9000G7-B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","100300.0","exact_match: 83.799","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P9000G7-B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)","P9000G7-B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","109755.0","ROUGE1: 44.7774 ROUGE2: 22.365 ROUGEL: 29.1457 TOKENS_PER_SAMPLE: 272.9","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P9000G7-B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Inventec","available","closed","datacenter","Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)","P9000G7-B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","106645.0","ROUGE1: 44.8297 ROUGE2: 22.3857 ROUGEL: 29.1786 TOKENS_PER_SAMPLE: 272.2","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Inventec/results/P9000G7-B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Lambda","available","closed","datacenter","Lambda Cloud 8x B200-SXM-180GB","B200-SXM-180GBx8_TRT","qwen3-vl-235b-a22b","VLM","Offline","101.56072395081954","0.7879966032452779","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B200-SXM-180GB","8","8","./closed/Lambda/results/B200-SXM-180GBx8_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT-LLM (GPT-OSS-120B); vLLM + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0","Ubuntu 24.04.4 LTS","8x NVIDIA B200-SXM-180GB (TGP 1000W).. GPT-OSS-120B via TensorRT-LLM LoadGen harness; Qwen3-VL-235B via NVIDIA inference-endpoint (vLLM+Dynamo), endpoint result format.","closed","0","v6.1","1","False","Samples/s","nvfp4","None","" "Lambda","available","closed","datacenter","Lambda Cloud 8x B200-SXM-180GB","B200-SXM-180GBx8_TRT","qwen3-vl-235b-a22b","VLM","Server","69.41536196217709","0.7878950642363143","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B200-SXM-180GB","8","8","./closed/Lambda/results/B200-SXM-180GBx8_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT-LLM (GPT-OSS-120B); vLLM + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0","Ubuntu 24.04.4 LTS","8x NVIDIA B200-SXM-180GB (TGP 1000W).. GPT-OSS-120B via TensorRT-LLM LoadGen harness; Qwen3-VL-235B via NVIDIA inference-endpoint (vLLM+Dynamo), endpoint result format.","closed","0","v6.1","1","False","Queries/s","nvfp4","None","" "Lambda","available","closed","datacenter","Lambda 4x GB300-288GB (GB300 NVL4, aarch64)","GB300-NVL4_GB300-288GB_aarch64x4","gpt-oss-120b","gpt-oss-120b","Offline","65511.9","exact_match: 82.738","1","NVIDIA Grace CPU (Arm Neoverse-V2)","2","72","NVIDIA GB300","4","4","./closed/Lambda/results/GB300-NVL4_GB300-288GB_aarch64x4/gpt-oss-120b/Offline/performance/run_1","TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0","Ubuntu 24.04.4 LTS (aarch64)","Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis/Enroot containers.","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "Lambda","available","closed","datacenter","Lambda 4x GB300-288GB (GB300 NVL4, aarch64)","GB300-NVL4_GB300-288GB_aarch64x4","gpt-oss-120b","gpt-oss-120b","Server","58195.8","exact_match: 83.079","1","NVIDIA Grace CPU (Arm Neoverse-V2)","2","72","NVIDIA GB300","4","4","./closed/Lambda/results/GB300-NVL4_GB300-288GB_aarch64x4/gpt-oss-120b/Server/performance/run_1","TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0","Ubuntu 24.04.4 LTS (aarch64)","Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis/Enroot containers.","closed","0","v6.1","0","False","Tokens/s","mxfp4","None","" "Lambda","available","closed","datacenter","Lambda 4x GB300-288GB (GB300 NVL4, aarch64)","GB300-NVL4_GB300-288GB_aarch64x4","qwen3-vl-235b-a22b","VLM","Offline","71.1217334486934","0.7874268401845349","1","NVIDIA Grace CPU (Arm Neoverse-V2)","2","72","NVIDIA GB300","4","4","./closed/Lambda/results/GB300-NVL4_GB300-288GB_aarch64x4/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0","Ubuntu 24.04.4 LTS (aarch64)","Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis/Enroot containers.","closed","0","v6.1","1","False","Samples/s","nvfp4","None","" "Lambda","available","closed","datacenter","Lambda 4x GB300-288GB (GB300 NVL4, aarch64)","GB300-NVL4_GB300-288GB_aarch64x4","qwen3-vl-235b-a22b","VLM","Server","64.62448277938189","0.787136982780776","1","NVIDIA Grace CPU (Arm Neoverse-V2)","2","72","NVIDIA GB300","4","4","./closed/Lambda/results/GB300-NVL4_GB300-288GB_aarch64x4/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0","Ubuntu 24.04.4 LTS (aarch64)","Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis/Enroot containers.","closed","0","v6.1","1","False","Queries/s","nvfp4","None","" "MangoBoost","available","closed","datacenter","MangoBoost 2x8 MI355X (16x MI355X, LLMBoost P/D Disaggregated Interactive Engine)","16xMI355X_2xEPYC_9575F","gpt-oss-120b","gpt-oss-120b","Interactive","59297.4","exact_match: 83.867","2","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","16","./closed/MangoBoost/results/16xMI355X_2xEPYC_9575F/gpt-oss-120b/Interactive/performance/run_1","ROCm 7.2.0","Ubuntu 22.04.5 LTS (jammy), kernel 6.8.0-84-generic","2-node MI355X connect with 8x 40GB/s RDMA NICs. P/D Disaggregation for Interavtive Scenario, and vLLM 0.22.1","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "MangoBoost","available","closed","datacenter","MangoBoost 2x8 MI355X (16x MI355X, LLMBoost P/D Disaggregated Interactive Engine)","16xMI355X_2xEPYC_9575F","gpt-oss-120b","gpt-oss-120b","Offline","228488.0","exact_match: 83.502","2","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","16","./closed/MangoBoost/results/16xMI355X_2xEPYC_9575F/gpt-oss-120b/Offline/performance/run_1","ROCm 7.2.0","Ubuntu 22.04.5 LTS (jammy), kernel 6.8.0-84-generic","2-node MI355X connect with 8x 40GB/s RDMA NICs. P/D Disaggregation for Interavtive Scenario, and vLLM 0.22.1","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "MangoBoost","available","closed","datacenter","8xMI300X_2xEPYC_9534","8xMI300X_2xEPYC_9534","gpt-oss-120b","gpt-oss-120b","Offline","30198.4","exact_match: 83.713","1","AMD EPYC 9534","2","64","AMD Instinct MI300X 192GB HBM3","8","8","./closed/MangoBoost/results/8xMI300X_2xEPYC_9534/gpt-oss-120b/Offline/performance/run_1","vLLM 0.24.0 (stock vllm/vllm-openai-rocm:v0.24.0), ROCm 7.2.1","Ubuntu 22.04.5 LTS","8xMI300X_2xEPYC_9534. Self-quantized w-fp8-a-fp8 gpt-oss-120b (AMD Quark 0.12) on stock vLLM 0.24.0 (vllm/vllm-openai-rocm:v0.24.0).","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "MangoBoost","available","closed","datacenter","8xMI300X_2xEPYC_9534","8xMI300X_2xEPYC_9534","gpt-oss-120b","gpt-oss-120b","Server","24863.0","exact_match: 82.842","1","AMD EPYC 9534","2","64","AMD Instinct MI300X 192GB HBM3","8","8","./closed/MangoBoost/results/8xMI300X_2xEPYC_9534/gpt-oss-120b/Server/performance/run_1","vLLM 0.24.0 (stock vllm/vllm-openai-rocm:v0.24.0), ROCm 7.2.1","Ubuntu 22.04.5 LTS","8xMI300X_2xEPYC_9534. Self-quantized w-fp8-a-fp8 gpt-oss-120b (AMD Quark 0.12) on stock vLLM 0.24.0 (vllm/vllm-openai-rocm:v0.24.0).","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","gpt-oss-120b","gpt-oss-120b","Offline","97019.7","exact_match: 83.639","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/gpt-oss-120b/Offline/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","gpt-oss-120b","gpt-oss-120b","Server","87549.5","exact_match: 83.316","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/gpt-oss-120b/Server/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","llama2-70b-99.9","llama2-70b-99.9","Interactive","56673.0","ROUGE1: 44.5133 ROUGE2: 22.148 ROUGEL: 28.9008 TOKENS_PER_SAMPLE: 284.9","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/llama2-70b-99.9/Interactive/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","llama2-70b-99.9","llama2-70b-99.9","Offline","84016.4","ROUGE1: 44.4551 ROUGE2: 22.0787 ROUGEL: 28.8207 TOKENS_PER_SAMPLE: 283.0","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/llama2-70b-99.9/Offline/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","llama2-70b-99.9","llama2-70b-99.9","Server","85004.8","ROUGE1: 44.5423 ROUGE2: 22.1706 ROUGEL: 28.9236 TOKENS_PER_SAMPLE: 284.5","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/llama2-70b-99.9/Server/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","llama3.1-8b","llama3.1-8b","Interactive","104368.0","ROUGE1: 38.5707 ROUGE2: 16.0354 ROUGEL: 24.4433 ROUGELSUM: 35.708 GEN_LEN: 8150585","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/llama3.1-8b/Interactive/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","llama3.1-8b","llama3.1-8b","Offline","129943.0","ROUGE1: 38.5694 ROUGE2: 16.0367 ROUGEL: 24.4456 ROUGELSUM: 35.7078 GEN_LEN: 8150329","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/llama3.1-8b/Offline/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "MiTAC","available","closed","datacenter","G8825Z5","8xMI350X_2xEPYC-9755","llama3.1-8b","llama3.1-8b","Server","121706.0","ROUGE1: 38.5208 ROUGE2: 16.0104 ROUGEL: 24.424 ROUGELSUM: 35.666 GEN_LEN: 8168845","1","AMD EPYC 9755","2","128","AMD Instinct MI350X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI350X_2xEPYC-9755/llama3.1-8b/Server/performance/run_1","Pytorch 2.10, ROCm 7.2.2","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","gpt-oss-120b","gpt-oss-120b","Offline","118042.0","exact_match: 83.861","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","gpt-oss-120b","gpt-oss-120b","Server","108861.0","exact_match: 84.039","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","llama2-70b-99.9","llama2-70b-99.9","Interactive","74385.6","ROUGE1: 44.5012 ROUGE2: 22.1509 ROUGEL: 28.9111 TOKENS_PER_SAMPLE: 284.1","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/llama2-70b-99.9/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","llama2-70b-99.9","llama2-70b-99.9","Offline","104904.0","ROUGE1: 44.5341 ROUGE2: 22.1837 ROUGEL: 28.9253 TOKENS_PER_SAMPLE: 284.3","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/llama2-70b-99.9/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","llama2-70b-99.9","llama2-70b-99.9","Server","104541.0","ROUGE1: 44.5342 ROUGE2: 22.1734 ROUGEL: 28.9337 TOKENS_PER_SAMPLE: 284.0","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/llama2-70b-99.9/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","llama3.1-8b","llama3.1-8b","Interactive","136999.0","ROUGE1: 38.5359 ROUGE2: 16.0141 ROUGEL: 24.4288 ROUGELSUM: 35.6751 GEN_LEN: 8162900","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/llama3.1-8b/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","llama3.1-8b","llama3.1-8b","Offline","159278.0","ROUGE1: 38.5554 ROUGE2: 16.0227 ROUGEL: 24.4331 ROUGELSUM: 35.6963 GEN_LEN: 8150276","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/llama3.1-8b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "MiTAC","available","closed","datacenter","G4826","8xMI355X_2xEPYC-9755","llama3.1-8b","llama3.1-8b","Server","151116.0","ROUGE1: 38.5121 ROUGE2: 15.9993 ROUGEL: 24.4128 ROUGELSUM: 35.6518 GEN_LEN: 8170944","1","AMD EPYC 9755","2","128","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/MiTAC/results/8xMI355X_2xEPYC-9755/llama3.1-8b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211","Ubuntu 24.04.4 LTS","","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "MiTAC","available","closed","datacenter","MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8","MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","30034.2","ROUGE1: 44.7186 ROUGE2: 22.3366 ROUGEL: 29.1057 TOKENS_PER_SAMPLE: 275.5","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/MiTAC/results/MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.2","Ubuntu 24.04.4","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "MiTAC","available","closed","datacenter","MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8","MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","29203.3","ROUGE1: 44.8047 ROUGE2: 22.3347 ROUGEL: 29.1315 TOKENS_PER_SAMPLE: 267.8","1","Intel(R) Xeon(R) 6787P","2","172","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/MiTAC/results/MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.2","Ubuntu 24.04.4","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","70132.3","exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3793.9359617137648","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","59867.8","exact_match: 81.17593436645396 TOKENS_PER_SAMPLE: 3818.7203737465816","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","106637.0","exact_match: 83.430","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","100630.0","exact_match: 83.702","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","109277.0","ROUGE1: 44.7951 ROUGE2: 22.3759 ROUGEL: 29.1534 TOKENS_PER_SAMPLE: 272.8","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","106949.0","ROUGE1: 44.8452 ROUGE2: 22.4177 ROUGEL: 29.2149 TOKENS_PER_SAMPLE: 272.7","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Interactive","3.9944289632075423","0.7863529411764706","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","bf16","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Offline","129.35839172137014","0.788067250804375","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","bf16","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Server","104.57819163892032","0.787266660240787","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","bf16","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.062188662827408765","0.7024464645142161","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","fp8","None","" "NVIDIA","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","17.97718330692361","0.7019984343473832","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/NVIDIA/results/B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Interactive","240274.0","exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3834.577939835916","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Offline","523790.0","exact_match: 81.0619872379216 TOKENS_PER_SAMPLE: 3795.436417502279","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Server","395940.0","exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3823.4881494986325","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Interactive","625205.0","exact_match: 83.374","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/gpt-oss-120b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Offline","883761.0","exact_match: 84.038","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Server","899005.0","exact_match: 83.914","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.4960942571652712","0.7018512713495823","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","fp8","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)","GB200-NVL72_GB200-186GB_aarch64x72_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","5.731549943319444","0.7027881259253183","18","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","72","./closed/NVIDIA/results/GB200-NVL72_GB200-186GB_aarch64x72_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB200 NVL72, 1200W TGP Per GPU","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x288_TRT","deepseek-r1","deepseek-r1","Offline","2705130.0","exact_match: 81.19872379216044 TOKENS_PER_SAMPLE: 3809.0271194165907","72","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","288","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x288_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x288_TRT","deepseek-r1","deepseek-r1","Server","2028030.0","exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3861.4316317228804","72","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","288","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x288_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Interactive","253506.0","exact_match: 81.40382862351869 TOKENS_PER_SAMPLE: 3825.619416590702","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Offline","679740.0","exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3800.5963992707384","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Server","596944.0","exact_match: 81.42661804922516 TOKENS_PER_SAMPLE: 3855.550136736554","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Interactive","669305.0","exact_match: 83.495","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Offline","1124500.0","exact_match: 82.861","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Server","1120710.0","exact_match: 83.069","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Interactive","349.2921988473666","0.7853930563050908","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","bf16","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Offline","1304.9852625797478","0.787383322355058","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","bf16","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Server","1210.48823482974","0.7869294905778593","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","bf16","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.6546111599325777","0.6979912810173431","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","fp8","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","5.807651162902777","0.6998451039205666","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","deepseek-r1","deepseek-r1","Offline","75918.2","exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3843.4847310847767","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","deepseek-r1","deepseek-r1","Server","67578.3","exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3829.014357338195","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","131619.0","exact_match: 82.963","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","gpt-oss-120b","gpt-oss-120b","Server","128173.0","exact_match: 83.020","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","131464.0","ROUGE1: 44.8017 ROUGE2: 22.3794 ROUGEL: 29.1616 TOKENS_PER_SAMPLE: 272.6","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","127911.0","ROUGE1: 44.8324 ROUGE2: 22.3953 ROUGEL: 29.1865 TOKENS_PER_SAMPLE: 272.1","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/NVIDIA/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "NVIDIA","available","closed","edge","NVIDIA Jetson AGX Thor Developer Kit 128G (TensorRT)","Jetson-Thor","qwen3.6-27b","agentic edge","SingleStream","1466.007675716981","0.8793969849246231","1","14-core ARM Poseidon-AE CPU","1","14","NVIDIA Jetson AGX Thor 128G","1","1","./closed/NVIDIA/results/Jetson-Thor/qwen3.6-27b/SingleStream/performance/run_1","TensorRT 10.16, CUDA 13.2","Jetson L4T","","closed","0","v6.1","1","False","Latency (ms)","fp4","None","" "NVIDIA","preview","closed","datacenter","NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)","VR200-NVL72_GR200-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Interactive","652750.1447708113","80.62898814949864","18","NVIDIA Vera CPU","2","144","NVIDIA VR200","4","72","./closed/NVIDIA/results/VR200-NVL72_GR200-288GB_aarch64x72_TRT/deepseek-r1/Interactive/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "NVIDIA","preview","closed","datacenter","NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)","VR200-NVL72_GR200-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Offline","1183326.8540322022","81.35824977210574","18","NVIDIA Vera CPU","2","144","NVIDIA VR200","4","72","./closed/NVIDIA/results/VR200-NVL72_GR200-288GB_aarch64x72_TRT/deepseek-r1/Offline/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "NVIDIA","preview","closed","datacenter","NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)","VR200-NVL72_GR200-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Server","1175890.2208168241","81.42661804922516","18","NVIDIA Vera CPU","2","144","NVIDIA VR200","4","72","./closed/NVIDIA/results/VR200-NVL72_GR200-288GB_aarch64x72_TRT/deepseek-r1/Server/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "NVIDIA","preview","closed","datacenter","NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)","VR200-NVL72_GR200-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Interactive","1306.6078446834506","0.7845128091628396","18","NVIDIA Vera CPU","2","144","NVIDIA VR200","4","72","./closed/NVIDIA/results/VR200-NVL72_GR200-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Interactive/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","bf16","None","" "NVIDIA","preview","closed","datacenter","NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)","VR200-NVL72_GR200-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Offline","2392.6979194587702","0.7871815525981819","18","NVIDIA Vera CPU","2","144","NVIDIA VR200","4","72","./closed/NVIDIA/results/VR200-NVL72_GR200-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","bf16","None","" "NVIDIA","preview","closed","datacenter","NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)","VR200-NVL72_GR200-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Server","2323.2698417825063","0.7874153796727632","18","NVIDIA Vera CPU","2","144","NVIDIA VR200","4","72","./closed/NVIDIA/results/VR200-NVL72_GR200-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","bf16","None","" "Naeem Khoshnevis","rdi","closed","datacenter","H200-1xGPU","H200","llama3.1-8b","llama3.1-8b","Offline","7796.585132594509","rouge1: 38.6405 rouge2: 15.9282 rougeL: 24.5018 rougeLsum: 35.7399 gen_len: 8222392 gen_num: 13368","1","AMD EPYC 9374F 32-Core Processor","2","32","NVIDIA H200-SXM-141GB","1","1","./closed/Naeem Khoshnevis/results/H200/llama3.1-8b/Offline/performance/run_1","TensorRT-LLM 1.0.0 (FP8 W8A8 engine built with trtllm-build, served by trtllm-serve); MLCommons endpoints (LoadGen++) client; CUDA 12.9","Rocky Linux 8.10","H200 node; 4x NVIDIA H200 141GB per node, 1 GPU used for llama3.1-8b. Subset-of-node use is disclosed: the job was cgroup-limited to 16 host CPU cores and 220-240 GB of host RAM depending on scenario (Offline 240 GB, Server 220 GB) out of the node's 2x32-core CPUs and 1.5 TB. GPU ECC verified enabled via nvidia-smi on the GPU used.. llama3.1-8b served by TensorRT-LLM 1.0.0 as an FP8 (W8A8) engine with FP8 KV cache. Weights quantized by NVIDIA ModelOpt static per-tensor PTQ calibrated on the MLPerf-official CNN/DailyMail calibration id list (calibration/CNNDailyMail/calibration-list.txt, 998 unique ids; ModelOpt consumed a 512-row prefix spanning 510 unique ids). Calibration inputs were reconstructed from the ids as raw article text, not the reference instruction-templated calibration file; see documentation/calibration.md. TP1. KV-cache block reuse explicitly DISABLED via --extra_llm_api_options (enable_block_reuse, enable_partial_reuse and copy_on_partial_reuse all false in both scenarios).","closed","0","v6.1","1","False","Tokens/s","fp8 (static per-tensor PTQ, NVIDIA ModelOpt)","None","" "Naeem Khoshnevis","rdi","closed","datacenter","H200-1xGPU","H200","llama3.1-8b","llama3.1-8b","Server","7376.597666232419","rouge1: 38.6354 rouge2: 15.9256 rougeL: 24.4991 rougeLsum: 35.7316 gen_len: 8222691 gen_num: 13368","1","AMD EPYC 9374F 32-Core Processor","2","32","NVIDIA H200-SXM-141GB","1","1","./closed/Naeem Khoshnevis/results/H200/llama3.1-8b/Server/performance/run_1","TensorRT-LLM 1.0.0 (FP8 W8A8 engine built with trtllm-build, served by trtllm-serve); MLCommons endpoints (LoadGen++) client; CUDA 12.9","Rocky Linux 8.10","H200 node; 4x NVIDIA H200 141GB per node, 1 GPU used for llama3.1-8b. Subset-of-node use is disclosed: the job was cgroup-limited to 16 host CPU cores and 220-240 GB of host RAM depending on scenario (Offline 240 GB, Server 220 GB) out of the node's 2x32-core CPUs and 1.5 TB. GPU ECC verified enabled via nvidia-smi on the GPU used.. llama3.1-8b served by TensorRT-LLM 1.0.0 as an FP8 (W8A8) engine with FP8 KV cache. Weights quantized by NVIDIA ModelOpt static per-tensor PTQ calibrated on the MLPerf-official CNN/DailyMail calibration id list (calibration/CNNDailyMail/calibration-list.txt, 998 unique ids; ModelOpt consumed a 512-row prefix spanning 510 unique ids). Calibration inputs were reconstructed from the ids as raw article text, not the reference instruction-templated calibration file; see documentation/calibration.md. TP1. KV-cache block reuse explicitly DISABLED via --extra_llm_api_options (enable_block_reuse, enable_partial_reuse and copy_on_partial_reuse all false in both scenarios).","closed","0","v6.1","1","False","Tokens/s","fp8 (static per-tensor PTQ, NVIDIA ModelOpt)","None","" "Nebius","available","closed","datacenter","Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)","B200-SXM-180GBx8_TRT","deepseek-r1","deepseek-r1","Offline","56929.9","exact_match: 81.08477666362808 TOKENS_PER_SAMPLE: 3808.5396536007293","1","Intel(R) Xeon(R) Platinum 8580","2","60","NVIDIA B200-SXM-180GB","8","8","./closed/Nebius/results/B200-SXM-180GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU/Linux)","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)","B200-SXM-180GBx8_TRT","deepseek-r1","deepseek-r1","Server","55869.0","exact_match: 80.62898814949864 TOKENS_PER_SAMPLE: 3840.4710574293526","1","Intel(R) Xeon(R) Platinum 8580","2","60","NVIDIA B200-SXM-180GB","8","8","./closed/Nebius/results/B200-SXM-180GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU/Linux)","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)","B200-SXM-180GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","88491.0","exact_match: 83.040","1","Intel(R) Xeon(R) Platinum 8580","2","60","NVIDIA B200-SXM-180GB","8","8","./closed/Nebius/results/B200-SXM-180GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU/Linux)","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)","B200-SXM-180GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","89856.3","exact_match: 82.998","1","Intel(R) Xeon(R) Platinum 8580","2","60","NVIDIA B200-SXM-180GB","8","8","./closed/Nebius/results/B200-SXM-180GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU/Linux)","B200 TGP 1000W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","69655.1","exact_match: 80.81130355515042 TOKENS_PER_SAMPLE: 3831.6855059252507","1","Intel(R) Xeon(R) Platinum 8570","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/Nebius/results/B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","63909.3","exact_match: 81.67730173199635 TOKENS_PER_SAMPLE: 3826.9986326344574","1","Intel(R) Xeon(R) Platinum 8570","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/Nebius/results/B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","108529.0","exact_match: 83.782","1","Intel(R) Xeon(R) Platinum 8570","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/Nebius/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","108124.0","exact_match: 83.224","1","Intel(R) Xeon(R) Platinum 8570","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/Nebius/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Offline","131.47716300755746","0.7877591584823119","1","Intel(R) Xeon(R) Platinum 8570","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/Nebius/results/B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","BF16/F32/F8_E4M3/U8","None","" "Nebius","available","closed","datacenter","Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Server","112.28582371293707","0.7876168551420853","1","Intel(R) Xeon(R) Platinum 8570","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/Nebius/results/B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","BF16/F32/F8_E4M3/U8","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","qwen3-vl-235b-a22b","VLM","Offline","73.18605442300793","0.7874581413977274","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","nvfp4, fp8 KV cache","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","qwen3-vl-235b-a22b","VLM","Server","64.61995222586359","0.7874065982485451","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","nvfp4, fp8 KV cache","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Offline","689961.0","exact_match: 80.94804010938924 TOKENS_PER_SAMPLE: 3831.7297174111213","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Server","603023.0","exact_match: 80.67456700091158 TOKENS_PER_SAMPLE: 3850.7272105742936","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Offline","1186750.0","exact_match: 82.905","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Server","1122490.0","exact_match: 83.174","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","132236.0","exact_match: 82.975","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","gpt-oss-120b","gpt-oss-120b","Server","127921.0","exact_match: 83.209","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/Nebius/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius RTX PRO 6000 n1 (8x RTX-PRO-6000-PCIE-96GB, TensorRT)","RTX_PRO_6000_PCIE_96GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","15738.5","exact_match: 83.832","1","Intel(R) Xeon(R) 6776P","2","96","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Nebius/results/RTX_PRO_6000_PCIE_96GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04.4 LTS, Linux 6.11.0-1016-nvidia","KVM virtual machine with 192 vCPUs presented as 2 sockets x 48 cores x 2 threads; 2 virtual NUMA nodes; 8 attached GPUs with 600 W power limit each. nvidia-smi reports CUDA 13.0 driver compatibility; CUDA toolkit and runtime versions are container-specific","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","available","closed","datacenter","Nebius RTX PRO 6000 n1 (8x RTX-PRO-6000-PCIE-96GB, TensorRT)","RTX_PRO_6000_PCIE_96GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","14784.3","exact_match: 83.717","1","Intel(R) Xeon(R) 6776P","2","96","NVIDIA RTX PRO 6000 Blackwell Server Edition","8","8","./closed/Nebius/results/RTX_PRO_6000_PCIE_96GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04.4 LTS, Linux 6.11.0-1016-nvidia","KVM virtual machine with 192 vCPUs presented as 2 sockets x 48 cores x 2 threads; 2 virtual NUMA nodes; 8 attached GPUs with 600 W power limit each. nvidia-smi reports CUDA 13.0 driver compatibility; CUDA toolkit and runtime versions are container-specific","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Nebius","preview","closed","datacenter","Nebius VR200 NVL72 (36x VR200-288GB_aarch64, TensorRT)","VR200-NVL72_aarch64x36","deepseek-r1","deepseek-r1","Offline","558802.8293934778","81.56335460346399","9","NVIDIA Vera CPU","2","352","NVIDIA VR200","4","36","./closed/Nebius/results/VR200-NVL72_aarch64x36/deepseek-r1/Offline/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Nebius","preview","closed","datacenter","Nebius VR200 NVL72 (36x VR200-288GB_aarch64, TensorRT)","VR200-NVL72_aarch64x36","deepseek-r1","deepseek-r1","Server","591368.312764167","81.03919781221514","9","NVIDIA Vera CPU","2","352","NVIDIA VR200","4","36","./closed/Nebius/results/VR200-NVL72_aarch64x36/deepseek-r1/Server/performance/run_1","TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo","Ubuntu 24.04","NVIDIA VR200 NVL72, 2300W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","BM.Standard4.Ax.120","1-node-1S-GNR_120C","llama3_1-8b","llama3.1-8b","Offline","853.14","ROUGE1: 38.7451 ROUGE2: 16.0022 ROUGEL: 24.5948 ROUGELSUM: 35.807 GEN_LEN: 8190646","1","Intel(R) Xeon(R) 6987P-C","1","120","N/A","0","0","./closed/Oracle/results/1-node-1S-GNR_120C/llama3_1-8b/Offline/performance/run_1","PyTorch","Oracle-Linux-9.7-2026.06.15-1","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Oracle","available","closed","datacenter","BM.Standard4.Ax.120","1-node-1S-GNR_120C","llama3_1-8b","llama3.1-8b","Server","324.995","ROUGE1: 38.7167 ROUGE2: 16.0067 ROUGEL: 24.5623 ROUGELSUM: 35.7763 GEN_LEN: 8199230","1","Intel(R) Xeon(R) 6987P-C","1","120","N/A","0","0","./closed/Oracle/results/1-node-1S-GNR_120C/llama3_1-8b/Server/performance/run_1","PyTorch","Oracle-Linux-9.7-2026.06.15-1","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Oracle","available","closed","datacenter","BM.Standard4.Ax.120","1-node-1S-GNR_120C","whisper","whisper","Offline","1099.64","ACCURACY: 97.86360951548667","1","Intel(R) Xeon(R) 6987P-C","1","120","N/A","0","0","./closed/Oracle/results/1-node-1S-GNR_120C/whisper/Offline/performance/run_1","PyTorch","Oracle-Linux-9.7-2026.06.15-1","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","gpt-oss-120b","gpt-oss-120b","Offline","115567.0","exact_match: 83.895","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","gpt-oss-120b","gpt-oss-120b","Server","109083.0","exact_match: 83.679","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","llama2-70b-99.9","llama2-70b-99.9","Interactive","70421.7","ROUGE1: 44.5013 ROUGE2: 22.1522 ROUGEL: 28.9162 TOKENS_PER_SAMPLE: 284.1","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/llama2-70b-99.9/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","llama2-70b-99.9","llama2-70b-99.9","Offline","101553.0","ROUGE1: 44.5168 ROUGE2: 22.1764 ROUGEL: 28.9174 TOKENS_PER_SAMPLE: 284.5","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/llama2-70b-99.9/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","llama2-70b-99.9","llama2-70b-99.9","Server","100392.0","ROUGE1: 44.5335 ROUGE2: 22.1719 ROUGEL: 28.9333 TOKENS_PER_SAMPLE: 284.1","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/llama2-70b-99.9/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","llama3.1-8b","llama3.1-8b","Interactive","130625.0","ROUGE1: 38.5651 ROUGE2: 16.0381 ROUGEL: 24.4433 ROUGELSUM: 35.7047 GEN_LEN: 8150907","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/llama3.1-8b/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","1","False","Tokens/s","fp8","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","llama3.1-8b","llama3.1-8b","Offline","144321.0","ROUGE1: 38.5632 ROUGE2: 16.0256 ROUGEL: 24.4374 ROUGELSUM: 35.7022 GEN_LEN: 8150941","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/llama3.1-8b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","llama3.1-8b","llama3.1-8b","Server","148594.0","ROUGE1: 38.5373 ROUGE2: 16.018 ROUGEL: 24.4335 ROUGELSUM: 35.6767 GEN_LEN: 8166290","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/llama3.1-8b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","wan-2.2-t2v-a14b","text_to_video","Offline","0.0706215","vbench_score: 69.9515","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/wan-2.2-t2v-a14b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Samples/s","bf16, fp8, fp4","None","" "Oracle","available","closed","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC-9575F","wan-2.2-t2v-a14b","text_to_video","SingleStream","16.334597792","vbench_score: 70.3415","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Oracle/results/8xMI355X_2xEPYC-9575F/wan-2.2-t2v-a14b/SingleStream/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2","Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)","8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization","closed","0","v6.1","0","False","Latency (s)","bf16, fp8, fp4","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","70354.0","exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3810.1563354603463","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","60745.5","exact_match: 81.35824977210574 TOKENS_PER_SAMPLE: 3858.553099361896","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","109931.0","exact_match: 83.311","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","100608.0","exact_match: 83.635","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","108026.0","ROUGE1: 44.7932 ROUGE2: 22.3753 ROUGEL: 29.152 TOKENS_PER_SAMPLE: 272.9","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","106696.0","ROUGE1: 44.8216 ROUGE2: 22.385 ROUGEL: 29.1799 TOKENS_PER_SAMPLE: 272.5","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Interactive","3.9944621629556996","0.7876188235945263","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","NVFP4 weights and activations; FP8 KV cache","None","" "Oracle","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Offline","124.38597378730044","0.7878245382101281","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","8","8","./closed/Oracle/results/B300-SXM-270GBx8_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","NVFP4 weights and activations; FP8 KV cache","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","gpt-oss-120b","gpt-oss-120b","Offline","60745.8","exact_match: 83.395","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","gpt-oss-120b","gpt-oss-120b","Server","59996.0","exact_match: 83.331","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","66001.9","ROUGE1: 44.7161 ROUGE2: 22.308 ROUGEL: 29.1704 TOKENS_PER_SAMPLE: 267.0","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","58991.9","ROUGE1: 44.7161 ROUGE2: 22.308 ROUGEL: 29.1704 TOKENS_PER_SAMPLE: 267.0","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","qwen3-vl-235b-a22b","VLM","Interactive","4.992209807647115","0.7862706307153826","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/qwen3-vl-235b-a22b/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","NVFP4 weights and activations; FP8 KV cache","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","qwen3-vl-235b-a22b","VLM","Offline","72.78618281809769","0.7881223292682367","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","NVFP4 weights and activations; FP8 KV cache","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","qwen3-vl-235b-a22b","VLM","Server","64.60782589940354","0.7881283191730583","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","NVFP4 weights and activations; FP8 KV cache","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.013837221211163476","0.7034961544029444","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","fp8","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","30.653359842875002","0.699114664501586","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Interactive","235807.0","exact_match: 81.28988149498633 TOKENS_PER_SAMPLE: 3770.5820419325432","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Interactive/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Offline","666613.0","exact_match: 81.42661804922516 TOKENS_PER_SAMPLE: 3825.77484047402","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","deepseek-r1","deepseek-r1","Server","586852.0","exact_match: 81.38103919781221 TOKENS_PER_SAMPLE: 3780.2771194165907","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Offline","1097620.0","exact_match: 83.395","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","gpt-oss-120b","gpt-oss-120b","Server","1092610.0","exact_match: 83.331","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Offline","1297.4909412305838","0.7868281285145724","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","NVFP4 weights and activations; FP8 KV cache","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","qwen3-vl-235b-a22b","VLM","Server","1146.388942892591","0.7878666850296102","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Queries/s","NVFP4 weights and activations; FP8 KV cache","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.3997628673298144","0.6948773298873472","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Samples/s","fp8","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x72_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","5.895425553486111","0.7028506315560222","18","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","72","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x72_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","1","False","Latency (s)","fp8","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","deepseek-r1","deepseek-r1","Offline","77031.7","exact_match: 81.42661804922516 TOKENS_PER_SAMPLE: 3803.590474020055","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","deepseek-r1","deepseek-r1","Server","68138.0","exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3861.967183226983","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","132253.0","ROUGE1: 44.8005 ROUGE2: 22.3791 ROUGEL: 29.1527 TOKENS_PER_SAMPLE: 272.6","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Oracle","available","closed","datacenter","NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","127984.0","ROUGE1: 44.8018 ROUGE2: 22.3668 ROUGEL: 29.141 TOKENS_PER_SAMPLE: 272.9","2","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","8","./closed/Oracle/results/GB300-NVL72_GB300-288GB_aarch64x8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Quanta_Cloud_Technology","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","llama3_1-8b","llama3.1-8b","Offline","1170.51","ROUGE1: 38.703 ROUGE2: 15.9823 ROUGEL: 24.5421 ROUGELSUM: 35.7696 GEN_LEN: 8188918","1","Intel(R) Xeon(R) 6788P","2","86","N/A","0","0","./closed/Quanta_Cloud_Technology/results/1-node-2S-GNR_86C/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 25.10","QuantaGrid D75E-4U. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Quanta_Cloud_Technology","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","llama3_1-8b","llama3.1-8b","Server","516.012","ROUGE1: 38.6189 ROUGE2: 15.8198 ROUGEL: 24.4192 ROUGELSUM: 35.6324 GEN_LEN: 8192507","1","Intel(R) Xeon(R) 6788P","2","86","N/A","0","0","./closed/Quanta_Cloud_Technology/results/1-node-2S-GNR_86C/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 25.10","QuantaGrid D75E-4U. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Quanta_Cloud_Technology","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","rgat","rgat","Offline","15633.3","acc: 71.489","1","Intel(R) Xeon(R) 6788P","2","86","N/A","0","0","./closed/Quanta_Cloud_Technology/results/1-node-2S-GNR_86C/rgat/Offline/performance/run_1","PyTorch","Ubuntu 25.10","QuantaGrid D75E-4U. N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Quanta_Cloud_Technology","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","whisper","whisper","Offline","1548.1","ACCURACY: 97.89045996917045","1","Intel(R) Xeon(R) 6788P","2","86","N/A","0","0","./closed/Quanta_Cloud_Technology/results/1-node-2S-GNR_86C/whisper/Offline/performance/run_1","PyTorch","Ubuntu 25.10","QuantaGrid D75E-4U. N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Quanta_Cloud_Technology","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama3_1-8b","llama3.1-8b","Offline","4977.67","ROUGE1: 38.8427 ROUGE2: 16.0895 ROUGEL: 24.6432 ROUGELSUM: 35.9449 GEN_LEN: 8127665","1","Intel(R) Xeon(R) 6788P","2","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Quanta_Cloud_Technology/results/1-node-4x-BMG-B70/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 25.10","QuantaGrid D75E-4U. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Quanta_Cloud_Technology","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama3_1-8b","llama3.1-8b","Server","4122.73","ROUGE1: 38.8436 ROUGE2: 16.0905 ROUGEL: 24.6447 ROUGELSUM: 35.9462 GEN_LEN: 8127418","1","Intel(R) Xeon(R) 6788P","2","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Quanta_Cloud_Technology/results/1-node-4x-BMG-B70/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 25.10","QuantaGrid D75E-4U. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Quanta_Cloud_Technology","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","whisper","whisper","Offline","5401.23","ACCURACY: 97.4509990485252","1","Intel(R) Xeon(R) 6788P","2","86","Intel(R) Arc(TM) Pro B70","4","4","./closed/Quanta_Cloud_Technology/results/1-node-4x-BMG-B70/whisper/Offline/performance/run_1","PyTorch","Ubuntu 25.10","QuantaGrid D75E-4U. N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","69841.6","exact_match: 81.58614402917047 TOKENS_PER_SAMPLE: 3773.390154968095","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","59622.2","exact_match: 81.17593436645396 TOKENS_PER_SAMPLE: 3821.9033728350046","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Offline","108293.0","exact_match: 83.431","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","gpt-oss-120b","gpt-oss-120b","Server","100183.0","exact_match: 83.451","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","113985.0","ROUGE1: 44.7969 ROUGE2: 22.3741 ROUGEL: 29.152 TOKENS_PER_SAMPLE: 272.6","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","106285.0","ROUGE1: 44.8968 ROUGE2: 22.4583 ROUGEL: 29.2397 TOKENS_PER_SAMPLE: 272.0","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Offline","131.7949949301423","0.7880292841897505","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","1","False","Samples/s","fp32","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","qwen3-vl-235b-a22b","VLM","Server","104.81182396432094","0.7875545886602456","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","1","False","Queries/s","fp32","None","" "Quanta_Cloud_Technology","available","closed","datacenter","QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)","D75H-10U_B300-270GBx8_TRT","whisper","whisper","Offline","45408.2","ACCURACY: 97.82350086127316","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Quanta_Cloud_Technology/results/D75H-10U_B300-270GBx8_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Rocky Linux 10.1","QuantaGrid D75H-10U","closed","0","v6.1","0","False","Samples/s","fp16","None","" "RedHat_Intel","available","closed","datacenter","1-node-2S-GNR_96C","1-node-2S-GNR_96C","llama3_1-8b","llama3.1-8b","Offline","1507.21","ROUGE1: 38.7872 ROUGE2: 16.0024 ROUGEL: 24.5918 ROUGELSUM: 35.7668 GEN_LEN: 8190420","1","Intel(R) Xeon(R) 6972P","2","96","N/A","0","0","./closed/RedHat_Intel/results/1-node-2S-GNR_96C/llama3_1-8b/Offline/performance/run_1","PyTorch","RHEL 9.9","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "RedHat_Intel","available","closed","datacenter","1-node-2S-GNR_96C","1-node-2S-GNR_96C","llama3_1-8b","llama3.1-8b","Server","644.788","ROUGE1: 38.606 ROUGE2: 15.7593 ROUGEL: 24.3946 ROUGELSUM: 35.6342 GEN_LEN: 8185295","1","Intel(R) Xeon(R) 6972P","2","96","N/A","0","0","./closed/RedHat_Intel/results/1-node-2S-GNR_96C/llama3_1-8b/Server/performance/run_1","PyTorch","RHEL 9.9","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "RedHat_Intel","available","closed","datacenter","1-node-2S-GNR_96C","1-node-2S-GNR_96C","whisper","whisper","Offline","1966.11","ACCURACY: 97.86193444026833","1","Intel(R) Xeon(R) 6972P","2","96","N/A","0","0","./closed/RedHat_Intel/results/1-node-2S-GNR_96C/whisper/Offline/performance/run_1","PyTorch","RHEL 9.9","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "RedHat_Supermicro","available","closed","datacenter","NVIDIA GB200 NVL4 (4x GB200-192GB_aarch64, vLLM)","GB200-NVL4-192GB_aarch64x4_VLLM","qwen3-vl-235b-a22b","VLM","Offline","58.07798401246531","0.7874682472480947","1","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","4","./closed/RedHat_Supermicro/results/GB200-NVL4-192GB_aarch64x4_VLLM/qwen3-vl-235b-a22b/Offline/performance/run_1","vLLM v0.20.2rc1.dev2091, CUDA 13.0.1, NVIDIA Dynamo, PyTorch 2.11.0+cu130","Red Hat Enterprise Linux 9.8","NVIDIA GB200 NVL4, 1200W TGP Per GPU, Supermicro chassis","closed","0","v6.1","1","False","Samples/s","fp4","None","" "RedHat_Supermicro","available","closed","datacenter","NVIDIA GB200 NVL4 (4x GB200-192GB_aarch64, vLLM)","GB200-NVL4-192GB_aarch64x4_VLLM","qwen3-vl-235b-a22b","VLM","Server","50.683789589484135","0.7877985363200543","1","NVIDIA Grace CPU","2","144","NVIDIA GB200","4","4","./closed/RedHat_Supermicro/results/GB200-NVL4-192GB_aarch64x4_VLLM/qwen3-vl-235b-a22b/Server/performance/run_1","vLLM v0.20.2rc1.dev2091, CUDA 13.0.1, NVIDIA Dynamo, PyTorch 2.11.0+cu130","Red Hat Enterprise Linux 9.8","NVIDIA GB200 NVL4, 1200W TGP Per GPU, Supermicro chassis","closed","0","v6.1","1","False","Queries/s","fp4","None","" "RedHat_Supermicro","available","closed","datacenter","SMC Lab OpenShift GB200-NVL4 4xGB200-186GB","GB200-NVL4_186GB_Openshift_VLLM","gpt-oss-120b","gpt-oss-120b","Offline","61205.6","exact_match: 83.695","1","NVIDIA Grace CPU","2","72","NVIDIA GB200","4","4","./closed/RedHat_Supermicro/results/GB200-NVL4_186GB_Openshift_VLLM/gpt-oss-120b/Offline/performance/run_1","vLLM 0.24.0, Red Hat OpenShift 4.21","Red Hat Enterprise Linux CoreOS 9.6","NVIDIA GB200 NVL4 with 2x Grace CPUs (72 ARM cores each), 4x GB200 GPUs (189GB HBM3e each). SMC Lab, Red Hat OpenShift 4.21, RHEL CoreOS 9.6, vLLM 0.24.0","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "RedHat_Supermicro","available","closed","datacenter","SMC Lab OpenShift GB200-NVL4 4xGB200-186GB","GB200-NVL4_186GB_Openshift_VLLM","gpt-oss-120b","gpt-oss-120b","Server","51095.2","exact_match: 83.948","1","NVIDIA Grace CPU","2","72","NVIDIA GB200","4","4","./closed/RedHat_Supermicro/results/GB200-NVL4_186GB_Openshift_VLLM/gpt-oss-120b/Server/performance/run_1","vLLM 0.24.0, Red Hat OpenShift 4.21","Red Hat Enterprise Linux CoreOS 9.6","NVIDIA GB200 NVL4 with 2x Grace CPUs (72 ARM cores each), 4x GB200 GPUs (189GB HBM3e each). SMC Lab, Red Hat OpenShift 4.21, RHEL CoreOS 9.6, vLLM 0.24.0","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Supermicro","available","closed","datacenter","1-node-2S-GNR_128C","1-node-2S-GNR_128C","llama3_1-8b","llama3.1-8b","Offline","1833.97","ROUGE1: 38.6493 ROUGE2: 15.8388 ROUGEL: 24.4665 ROUGELSUM: 35.6409 GEN_LEN: 8186666","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Supermicro/results/1-node-2S-GNR_128C/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3","SYS-422GA-NRT. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-2S-GNR_128C","1-node-2S-GNR_128C","llama3_1-8b","llama3.1-8b","Server","1101.19","ROUGE1: 38.7236 ROUGE2: 15.8895 ROUGEL: 24.4948 ROUGELSUM: 35.7134 GEN_LEN: 8199179","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Supermicro/results/1-node-2S-GNR_128C/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 24.04.3","SYS-422GA-NRT. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-2S-GNR_128C","1-node-2S-GNR_128C","whisper","whisper","Offline","2248.15","ACCURACY: 97.89525766917866","1","Intel(R) Xeon(R) 6980P","2","128","N/A","0","0","./closed/Supermicro/results/1-node-2S-GNR_128C/whisper/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3","SYS-422GA-NRT. N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","llama3_1-8b","llama3.1-8b","Offline","1189.89","ROUGE1: 38.7008 ROUGE2: 15.8479 ROUGEL: 24.4355 ROUGELSUM: 35.7034 GEN_LEN: 8193707","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Supermicro/results/1-node-2S-GNR_86C/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3","SYS-422GB-NRT. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","llama3_1-8b","llama3.1-8b","Server","516.059","ROUGE1: 38.7059 ROUGE2: 15.8614 ROUGEL: 24.4785 ROUGELSUM: 35.726 GEN_LEN: 8175493","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Supermicro/results/1-node-2S-GNR_86C/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 24.04.3","SYS-422GB-NRT. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","rgat","rgat","Offline","13273.7","acc: 72.520","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Supermicro/results/1-node-2S-GNR_86C/rgat/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3","SYS-422GB-NRT. N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-2S-GNR_86C","1-node-2S-GNR_86C","whisper","whisper","Offline","1477.4","ACCURACY: 97.89045996917045","1","Intel(R) Xeon(R) 6787P","2","86","N/A","0","0","./closed/Supermicro/results/1-node-2S-GNR_86C/whisper/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3","SYS-422GB-NRT. N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4S-GNR_86C","1-node-4S-GNR_86C","llama3_1-8b","llama3.1-8b","Offline","2063.24","ROUGE1: 38.5949 ROUGE2: 15.7867 ROUGEL: 24.3919 ROUGELSUM: 35.6229 GEN_LEN: 8190845","1","Intel(R) Xeon(R) 6788P","4","86","N/A","0","0","./closed/Supermicro/results/1-node-4S-GNR_86C/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3 LTS","SYS-442B-NR. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4S-GNR_86C","1-node-4S-GNR_86C","llama3_1-8b","llama3.1-8b","Server","966.241","ROUGE1: 38.7724 ROUGE2: 16.0093 ROUGEL: 24.5982 ROUGELSUM: 35.8002 GEN_LEN: 8168484","1","Intel(R) Xeon(R) 6788P","4","86","N/A","0","0","./closed/Supermicro/results/1-node-4S-GNR_86C/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 24.04.3 LTS","SYS-442B-NR. N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4S-GNR_86C","1-node-4S-GNR_86C","whisper","whisper","Offline","2881.28","ACCURACY: 97.9447557970256","1","Intel(R) Xeon(R) 6788P","4","86","N/A","0","0","./closed/Supermicro/results/1-node-4S-GNR_86C/whisper/Offline/performance/run_1","PyTorch","Ubuntu 24.04.3 LTS","SYS-442B-NR. N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","gpt-oss-120b","gpt-oss-120b","Offline","2063.93","exact_match: 83.780","1","Intel(R) Xeon(R) 6731P","1","32","Intel(R) Arc(TM) Pro B70","4","4","./closed/Supermicro/results/1-node-4x-BMG-B70/gpt-oss-120b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","MXFP4","None","" "Supermicro","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","gpt-oss-120b","gpt-oss-120b","Server","1351.13","exact_match: 84.186","1","Intel(R) Xeon(R) 6731P","1","32","Intel(R) Arc(TM) Pro B70","4","4","./closed/Supermicro/results/1-node-4x-BMG-B70/gpt-oss-120b/Server/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","MXFP4","None","" "Supermicro","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama2-70b-99.9","llama2-70b-99.9","Offline","2484.14","ROUGE1: 44.585 ROUGE2: 22.2008 ROUGEL: 28.8241 TOKENS_PER_SAMPLE: 290.8","1","Intel(R) Xeon(R) 6731P","1","32","Intel(R) Arc(TM) Pro B70","4","4","./closed/Supermicro/results/1-node-4x-BMG-B70/llama2-70b-99.9/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama2-70b-99.9","llama2-70b-99.9","Server","1759.95","ROUGE1: 44.591 ROUGE2: 22.2044 ROUGEL: 28.8277 TOKENS_PER_SAMPLE: 290.8","1","Intel(R) Xeon(R) 6731P","1","32","Intel(R) Arc(TM) Pro B70","4","4","./closed/Supermicro/results/1-node-4x-BMG-B70/llama2-70b-99.9/Server/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama3_1-8b","llama3.1-8b","Offline","4596.62","ROUGE1: 38.8447 ROUGE2: 16.0909 ROUGEL: 24.6442 ROUGELSUM: 35.9477 GEN_LEN: 8127563","1","Intel(R) Xeon(R) 6731P","1","32","Intel(R) Arc(TM) Pro B70","4","4","./closed/Supermicro/results/1-node-4x-BMG-B70/llama3_1-8b/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","llama3_1-8b","llama3.1-8b","Server","4208.73","ROUGE1: 38.8128 ROUGE2: 16.082 ROUGEL: 24.6384 ROUGELSUM: 35.9155 GEN_LEN: 8126189","1","Intel(R) Xeon(R) 6731P","1","32","Intel(R) Arc(TM) Pro B70","4","4","./closed/Supermicro/results/1-node-4x-BMG-B70/llama3_1-8b/Server/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Tokens/s","INT8","None","" "Supermicro","available","closed","datacenter","1-node-4x-BMG-B70","1-node-4x-BMG-B70","whisper","whisper","Offline","5854.85","ACCURACY: 97.49980776624375","1","Intel(R) Xeon(R) 6731P","1","32","Intel(R) Arc(TM) Pro B70","4","4","./closed/Supermicro/results/1-node-4x-BMG-B70/whisper/Offline/performance/run_1","PyTorch","Ubuntu 24.04.4 LTS","N/A","closed","0","v6.1","0","False","Samples/s","INT8","None","" "Supermicro","available","closed","datacenter","AS-4126GS-NMR-LCC","8xMI355X_2xEPYC-9575F","gpt-oss-120b","gpt-oss-120b","Offline","117005.0","exact_match: 83.113","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Supermicro/results/8xMI355X_2xEPYC-9575F/gpt-oss-120b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4","Ubuntu 26.04 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-4126GS-NMR-LCC","8xMI355X_2xEPYC-9575F","gpt-oss-120b","gpt-oss-120b","Server","109184.0","exact_match: 83.861","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Supermicro/results/8xMI355X_2xEPYC-9575F/gpt-oss-120b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4","Ubuntu 26.04 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-4126GS-NMR-LCC","8xMI355X_2xEPYC-9575F","llama2-70b-99.9","llama2-70b-99.9","Interactive","73181.5","ROUGE1: 44.507 ROUGE2: 22.1597 ROUGEL: 28.9194 TOKENS_PER_SAMPLE: 284.1","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Supermicro/results/8xMI355X_2xEPYC-9575F/llama2-70b-99.9/Interactive/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4","Ubuntu 26.04 LTS","","closed","0","v6.1","1","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-4126GS-NMR-LCC","8xMI355X_2xEPYC-9575F","llama2-70b-99.9","llama2-70b-99.9","Offline","102243.0","ROUGE1: 44.5269 ROUGE2: 22.1836 ROUGEL: 28.9207 TOKENS_PER_SAMPLE: 284.3","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Supermicro/results/8xMI355X_2xEPYC-9575F/llama2-70b-99.9/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4","Ubuntu 26.04 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-4126GS-NMR-LCC","8xMI355X_2xEPYC-9575F","llama2-70b-99.9","llama2-70b-99.9","Server","103032.0","ROUGE1: 44.5345 ROUGE2: 22.1731 ROUGEL: 28.933 TOKENS_PER_SAMPLE: 284.0","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Supermicro/results/8xMI355X_2xEPYC-9575F/llama2-70b-99.9/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4","Ubuntu 26.04 LTS","","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-4126GS-NMR-LCC","8xMI355X_2xEPYC-9575F","llama3.1-8b","llama3.1-8b","Offline","159060.0","ROUGE1: 38.5437 ROUGE2: 16.0099 ROUGEL: 24.4209 ROUGELSUM: 35.6859 GEN_LEN: 8150015","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Supermicro/results/8xMI355X_2xEPYC-9575F/llama3.1-8b/Offline/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4","Ubuntu 26.04 LTS","","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Supermicro","available","closed","datacenter","AS-4126GS-NMR-LCC","8xMI355X_2xEPYC-9575F","llama3.1-8b","llama3.1-8b","Server","148710.0","ROUGE1: 38.5048 ROUGE2: 15.9985 ROUGEL: 24.4065 ROUGELSUM: 35.652 GEN_LEN: 8176781","1","AMD EPYC 9575F","2","64","AMD Instinct MI355X 288GB HBM3e","8","8","./closed/Supermicro/results/8xMI355X_2xEPYC-9575F/llama3.1-8b/Server/performance/run_1","vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4","Ubuntu 26.04 LTS","","closed","0","v6.1","0","False","Tokens/s","fp8","None","" "Supermicro","available","closed","datacenter","AS-8126GS-NB3RT","AS-8126GS-NB3RT_B300-SXM-288GB_TRT","deepseek-r1","deepseek-r1","Offline","69830.0","exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3839.5469462169553","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/AS-8126GS-NB3RT_B300-SXM-288GB_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-8126GS-NB3RT","AS-8126GS-NB3RT_B300-SXM-288GB_TRT","deepseek-r1","deepseek-r1","Server","61164.9","exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3850.996809480401","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/AS-8126GS-NB3RT_B300-SXM-288GB_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-8126GS-NB3RT","AS-8126GS-NB3RT_B300-SXM-288GB_TRT","gpt-oss-120b","gpt-oss-120b","Offline","108727.0","exact_match: 83.743","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/AS-8126GS-NB3RT_B300-SXM-288GB_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-8126GS-NB3RT","AS-8126GS-NB3RT_B300-SXM-288GB_TRT","gpt-oss-120b","gpt-oss-120b","Server","107288.0","exact_match: 83.354","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/AS-8126GS-NB3RT_B300-SXM-288GB_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-8126GS-NB3RT","AS-8126GS-NB3RT_B300-SXM-288GB_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","110802.0","ROUGE1: 44.8018 ROUGE2: 22.3841 ROUGEL: 29.1588 TOKENS_PER_SAMPLE: 272.7","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/AS-8126GS-NB3RT_B300-SXM-288GB_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","AS-8126GS-NB3RT","AS-8126GS-NB3RT_B300-SXM-288GB_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","106872.0","ROUGE1: 44.828 ROUGE2: 22.4004 ROUGEL: 29.1931 TOKENS_PER_SAMPLE: 272.0","1","AMD EPYC 9575F","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/AS-8126GS-NB3RT_B300-SXM-288GB_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","deepseek-r1","deepseek-r1","Offline","69104.0","exact_match: 81.58614402917047 TOKENS_PER_SAMPLE: 3787.6494986326343","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","deepseek-r1","deepseek-r1","Server","66754.3","exact_match: 80.92525068368278 TOKENS_PER_SAMPLE: 3729.1365086599817","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","gpt-oss-120b","gpt-oss-120b","Offline","107851.0","exact_match: 83.592","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","gpt-oss-120b","gpt-oss-120b","Server","107205.0","exact_match: 83.457","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","llama2-70b-99.9","llama2-70b-99.9","Offline","111247.0","ROUGE1: 44.7966 ROUGE2: 22.3806 ROUGEL: 29.1557 TOKENS_PER_SAMPLE: 272.7","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","llama2-70b-99.9","llama2-70b-99.9","Server","109848.0","ROUGE1: 44.799 ROUGE2: 22.3988 ROUGEL: 29.1884 TOKENS_PER_SAMPLE: 272.3","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","qwen3-vl-235b-a22b","VLM","Offline","128.90612412004543","0.7870632563988416","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/qwen3-vl-235b-a22b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Samples/s","BF16/F8_E4M3/U8","None","" "Supermicro","available","closed","datacenter","SYS-822GS-NB3RT","SYS-822GS-NB3RT","qwen3-vl-235b-a22b","VLM","Server","111.77383650675426","0.7871852181615411","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B300-SXM-270GB","8","8","./closed/Supermicro/results/SYS-822GS-NB3RT/qwen3-vl-235b-a22b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","1","False","Queries/s","BF16/F8_E4M3/U8","None","" "TTA","available","closed","datacenter","ManyCoreSoft DeepGadget dg5W (4x NVIDIA RTX PRO 6000 Blackwell 96GB, TensorRT)","DeepGadget_dg5W_RTXPro6000_96GBx4_TRT","llama3.1-8b","llama3.1-8b","Offline","24511.8","ROUGE1: 38.5238 ROUGE2: 15.9869 ROUGEL: 24.3988 ROUGELSUM: 35.6579 GEN_LEN: 8178576","1","AMD EPYC 9124","1","16","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/TTA/results/DeepGadget_dg5W_RTXPro6000_96GBx4_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14.1.48, CUDA 13.1","Rocky Linux 9.7","DeepGadget dg5W; ManyCoreSoft dg5W (SKU2-T1) chassis, GENOAD8X-2T/BCM mainboard; 4x NVIDIA RTX PRO 6000 Blackwell Server Edition (TGP 600W each); direct liquid cooling (DLC)","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "TTA","available","closed","datacenter","ManyCoreSoft DeepGadget dg5W (4x NVIDIA RTX PRO 6000 Blackwell 96GB, TensorRT)","DeepGadget_dg5W_RTXPro6000_96GBx4_TRT","llama3.1-8b","llama3.1-8b","Server","24510.5","ROUGE1: 38.5242 ROUGE2: 15.9887 ROUGEL: 24.3995 ROUGELSUM: 35.6582 GEN_LEN: 8178682","1","AMD EPYC 9124","1","16","NVIDIA RTX PRO 6000 Blackwell Server Edition","4","4","./closed/TTA/results/DeepGadget_dg5W_RTXPro6000_96GBx4_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14.1.48, CUDA 13.1","Rocky Linux 9.7","DeepGadget dg5W; ManyCoreSoft dg5W (SKU2-T1) chassis, GENOAD8X-2T/BCM mainboard; 4x NVIDIA RTX PRO 6000 Blackwell Server Edition (TGP 600W each); direct liquid cooling (DLC)","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","B300-SXM-270GBx1_TRT","B300-SXM-270GBx1_TRT","gpt-oss-120b","gpt-oss-120b","Offline","14130.6","exact_match: 83.235","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","1","1","./closed/VibeHPC/results/B300-SXM-270GBx1_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","B300-SXM-270GBx1_TRT","B300-SXM-270GBx1_TRT","gpt-oss-120b","gpt-oss-120b","Server","13854.0","exact_match: 83.289","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","1","1","./closed/VibeHPC/results/B300-SXM-270GBx1_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","B300-SXM-270GBx1_TRT","B300-SXM-270GBx1_TRT","llama2-70b-99.9","llama2-70b-99.9","Offline","14636.8","ROUGE1: 44.781 ROUGE2: 22.3679 ROUGEL: 29.1539 TOKENS_PER_SAMPLE: 273.1","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","1","1","./closed/VibeHPC/results/B300-SXM-270GBx1_TRT/llama2-70b-99.9/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","B300-SXM-270GBx1_TRT","B300-SXM-270GBx1_TRT","llama2-70b-99.9","llama2-70b-99.9","Server","14495.6","ROUGE1: 44.7255 ROUGE2: 22.327 ROUGEL: 29.1172 TOKENS_PER_SAMPLE: 274.2","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","1","1","./closed/VibeHPC/results/B300-SXM-270GBx1_TRT/llama2-70b-99.9/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","B300-SXM-270GBx1_TRT","B300-SXM-270GBx1_TRT","llama3.1-8b","llama3.1-8b","Offline","21266.1","ROUGE1: 38.5346 ROUGE2: 15.7631 ROUGEL: 24.3218 ROUGELSUM: 35.5543 GEN_LEN: 8191123","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","1","1","./closed/VibeHPC/results/B300-SXM-270GBx1_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","B300-SXM-270GBx1_TRT","B300-SXM-270GBx1_TRT","llama3.1-8b","llama3.1-8b","Server","20420.4","ROUGE1: 38.5378 ROUGE2: 15.764 ROUGEL: 24.3237 ROUGELSUM: 35.5571 GEN_LEN: 8191033","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","1","1","./closed/VibeHPC/results/B300-SXM-270GBx1_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","B300-SXM-270GBx1_TRT","B300-SXM-270GBx1_TRT","whisper","whisper","Offline","7058.95","ACCURACY: 97.85680976807484","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B300-SXM-270GB","1","1","./closed/VibeHPC/results/B300-SXM-270GBx1_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Samples/s","fp16","None","" "VibeHPC","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Offline","36639.6","exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3770.8865086599817","1","Intel(R) Xeon(R) 6776P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/VibeHPC/results/B300-SXM-270GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","deepseek-r1","deepseek-r1","Server","33415.2","exact_match: 81.83682771194167 TOKENS_PER_SAMPLE: 3750.4530537830447","1","Intel(R) Xeon(R) 6776P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/VibeHPC/results/B300-SXM-270GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","llama3.1-8b","llama3.1-8b","Offline","161767.0","ROUGE1: 38.5395 ROUGE2: 15.7648 ROUGEL: 24.3262 ROUGELSUM: 35.5597 GEN_LEN: 8190944","1","Intel(R) Xeon(R) 6776P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/VibeHPC/results/B300-SXM-270GBx8_TRT/llama3.1-8b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","llama3.1-8b","llama3.1-8b","Server","156867.0","ROUGE1: 38.5355 ROUGE2: 15.7593 ROUGEL: 24.3212 ROUGELSUM: 35.5549 GEN_LEN: 8191008","1","Intel(R) Xeon(R) 6776P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/VibeHPC/results/B300-SXM-270GBx8_TRT/llama3.1-8b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "VibeHPC","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","Offline","0.0783824","vbench_score: 70.1187","1","Intel(R) Xeon(R) 6776P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/VibeHPC/results/B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Samples/s","fp32","None","" "VibeHPC","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","wan-2.2-t2v-a14b","text_to_video","SingleStream","21.279754716","vbench_score: 70.3113","1","Intel(R) Xeon(R) 6776P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/VibeHPC/results/B300-SXM-270GBx8_TRT/wan-2.2-t2v-a14b/SingleStream/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Latency (s)","fp32","None","" "VibeHPC","available","closed","datacenter","NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)","B300-SXM-270GBx8_TRT","whisper","whisper","Offline","53267.2","ACCURACY: 97.85680976807484","1","Intel(R) Xeon(R) 6776P","2","48","NVIDIA B300-SXM-270GB","8","8","./closed/VibeHPC/results/B300-SXM-270GBx8_TRT/whisper/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1","Ubuntu 24.04","B300 TGP 1100W","closed","0","v6.1","0","False","Samples/s","fp16","None","" "Wiwynn","available","closed","datacenter","OneW GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","gpt-oss-120b","gpt-oss-120b","Offline","63990.5","exact_match: 83.440","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Wiwynn/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/gpt-oss-120b/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "Wiwynn","available","closed","datacenter","OneW GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)","GB300-NVL72_GB300-288GB_aarch64x4_TRT","gpt-oss-120b","gpt-oss-120b","Server","60466.2","exact_match: 83.187","1","NVIDIA Grace CPU","2","144","NVIDIA GB300","4","4","./closed/Wiwynn/results/GB300-NVL72_GB300-288GB_aarch64x4_TRT/gpt-oss-120b/Server/performance/run_1","TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf","Ubuntu 24.04","NVIDIA GB300 NVL72, 1400W TGP Per GPU","closed","0","v6.1","0","False","Tokens/s","fp4","None","" "AMD","available","open","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC_9575F","dlrm-v3","dlrm-v3","Offline","16363.0","DLRM_NE: 0.8678795984098008 DLRM_ACC: 0.6962884623080815 DLRM_AUC: 0.7861666437936649","1","AMD EPYC 9575F","2","64 cores per socket, 128 total cores, 256 threads","AMD Instinct MI355X","8","8","./open/AMD/results/8xMI355X_2xEPYC_9575F/dlrm-v3/Offline/performance/run_1","PyTorch 2.10.0+rocm7.2.3.git1a270074, Triton 3.6.0, ROCm 7.2.3","Ubuntu 24.04.3 LTS (Noble Numbat), kernel 6.8.0-134-generic","Measured on current chi2810-class host reporting hostname chi2878: 8x MI355X / 2x EPYC 9575F, 256 online CPUs, SMT enabled, CPU governor performance. Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm C1-on stack: HSTU sliding-window attention (window 1024), batch 64, degree-5 SiLU gate, uniform-target metadata, and FP8 quantization. MLPerf Inference v6.1 seeds with LoadGen 6.0.17. Server target 16,200 q/s; Offline target 17,000 q/s.","open","0","v6.1","0","False","Samples/s","fp16,bf16,fp8","None","" "AMD","available","open","datacenter","8xMI355X_2xEPYC_9575F","8xMI355X_2xEPYC_9575F","dlrm-v3","dlrm-v3","Server","16194.4","DLRM_NE: 0.8678772746839061 DLRM_ACC: 0.6962803331970739 DLRM_AUC: 0.7861629372250531","1","AMD EPYC 9575F","2","64 cores per socket, 128 total cores, 256 threads","AMD Instinct MI355X","8","8","./open/AMD/results/8xMI355X_2xEPYC_9575F/dlrm-v3/Server/performance/run_1","PyTorch 2.10.0+rocm7.2.3.git1a270074, Triton 3.6.0, ROCm 7.2.3","Ubuntu 24.04.3 LTS (Noble Numbat), kernel 6.8.0-134-generic","Measured on current chi2810-class host reporting hostname chi2878: 8x MI355X / 2x EPYC 9575F, 256 online CPUs, SMT enabled, CPU governor performance. Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm C1-on stack: HSTU sliding-window attention (window 1024), batch 64, degree-5 SiLU gate, uniform-target metadata, and FP8 quantization. MLPerf Inference v6.1 seeds with LoadGen 6.0.17. Server target 16,200 q/s; Offline target 17,000 q/s.","open","0","v6.1","0","False","Queries/s","fp16,bf16,fp8","None","" "HPE","available","open","datacenter","NVIDIA GB200 NVL72 by HPE (16x GB200-186GB_aarch64, TensorRT)","HPE_GB200-NVL72_GB200-186GB_aarch64x16_TRT","deepseek-r1","deepseek-r1","Offline","126223.0","exact_match: 81.38103919781221 TOKENS_PER_SAMPLE: 3823.224020054695","4","NVIDIA Grace CPU (Arm Neoverse-V2)","2","144","NVIDIA GB200","4","16","./open/HPE/results/HPE_GB200-NVL72_GB200-186GB_aarch64x16_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k","NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Two dep8 replicas across four nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint","open","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","open","datacenter","NVIDIA GB200 NVL72 by HPE (32x GB200-186GB_aarch64, TensorRT)","HPE_GB200-NVL72_GB200-186GB_aarch64x32_TRT","deepseek-r1","deepseek-r1","Offline","245352.0","exact_match: 81.8824065633546 TOKENS_PER_SAMPLE: 3798.4737921604374","8","NVIDIA Grace CPU (Arm Neoverse-V2)","2","144","NVIDIA GB200","4","32","./open/HPE/results/HPE_GB200-NVL72_GB200-186GB_aarch64x32_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k","NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Four dep8 replicas across eight nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint","open","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","open","datacenter","NVIDIA GB200 NVL72 by HPE (56x GB200-186GB_aarch64, TensorRT)","HPE_GB200-NVL72_GB200-186GB_aarch64x56_TRT","deepseek-r1","deepseek-r1","Offline","336125.0","exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3836.976071103008","14","NVIDIA Grace CPU (Arm Neoverse-V2)","2","144","NVIDIA GB200","4","56","./open/HPE/results/HPE_GB200-NVL72_GB200-186GB_aarch64x56_TRT/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0","Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k","NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. The LoadGen task shares one inference node CPU allocation and is not an additional SUT node.. Seven dep8 replicas across fourteen inference nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint","open","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","open","edge","HPE ProLiant DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB, TensorRT)","HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open","llama3.1-8b-edge","llama3.1-8b-edge","Offline","9557.69","ROUGE1: 38.7947 ROUGE2: 16.0822 ROUGEL: 24.5817 ROUGELSUM: 35.7134 GEN_LEN: 8173143","1","AMD EPYC 9375F 32-Core Processor","1","32","NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB","4","4","./open/HPE/results/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open/llama3.1-8b-edge/Offline/performance/run_1","TensorRT 10.15.1.29, CUDA 13.2","Ubuntu 24.04.4","","open","0","v6.1","0","False","Tokens/s","fp4","None","" "HPE","available","open","edge","HPE ProLiant DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB, TensorRT)","HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open","llama3.1-8b-edge","llama3.1-8b-edge","SingleStream","1203.785699","ROUGE1: 38.7883 ROUGE2: 16.056 ROUGEL: 24.5055 ROUGELSUM: 35.724 GEN_LEN: 8183134","1","AMD EPYC 9375F 32-Core Processor","1","32","NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB","4","4","./open/HPE/results/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open/llama3.1-8b-edge/SingleStream/performance/run_1","TensorRT 10.15.1.29, CUDA 13.2","Ubuntu 24.04.4","","open","0","v6.1","0","False","Latency (ms)","fp4","None","" "HPE","available","open","edge","HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB)","HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open","resnet50","resnet","multistream","5.030642","acc: 77.805","1","Intel(R) Xeon(R) 6762P","2","64","NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB","1","1","./open/HPE/results/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open/resnet50/multistream/performance/run_1","ONNX Runtime v1.28.0","Ubuntu 24.04.3","","open","0","v6.1","1","False","Latency (ms)","fp32","None","" "HPE","available","open","edge","HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB)","HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open","resnet50","resnet","singlestream","1.480867","acc: 77.536","1","Intel(R) Xeon(R) 6762P","2","64","NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB","1","1","./open/HPE/results/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open/resnet50/singlestream/performance/run_1","ONNX Runtime v1.28.0","Ubuntu 24.04.3","","open","0","v6.1","1","False","Latency (ms)","fp32","None","" "HPE","available","open","datacenter","HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)","HPE_XD690_B300_SXM_270GBx8_TRT_open","deepseek-r1","deepseek-r1","Offline","71053.4","exact_match: 81.08477666362808 TOKENS_PER_SAMPLE: 3818.841841385597","1","Intel(R) Xeon(R) 6776P","2","64","NVIDIA B300-SXM-270GB","8","8","./open/HPE/results/HPE_XD690_B300_SXM_270GBx8_TRT_open/deepseek-r1/Offline/performance/run_1","TensorRT 10.14, CUDA 13.2","RHEL 9.4","B300 TGP 1100W","open","0","v6.1","0","False","Tokens/s","fp4","None","" "Krai","available","open","datacenter","HPE Cray XD670 (8x H200-SXM-141GB, Krai/Gentic)","h200","qwen3-vl-235b-a22b","VLM","Offline","9.221680429087034","0.7878368975913989","1","Intel(R) Xeon(R) Platinum 8562Y+","2","32","NVIDIA H200-SXM-141GB","8","8","./open/Krai/results/h200/qwen3-vl-235b-a22b/Offline/performance/run_1","Krai/Gentic","Red Hat Enterprise Linux release 9.4 (Plow) (Linux kernel: 5.14.0-427.13.1.el9_4.x86_64 #1 SMP PREEMPT_DYNAMIC Wed Apr 10 10:29:16 EDT 2024 x86_64 x86_64 x86_64 GNU/Linux)","Powered by Krai/Gentic, next-gen automation","open","0","v6.1","1","False","Samples/s","bf16","None","" "Lambda","available","open","edge","Lambda 8x B200-SXM-180GB (SGLang, Kimi-K2.6 edge-agentic / BFCL v4)","B200-SXM-180GBx8_SGLANG","qwen3.6-27b","agentic edge","SingleStream","770.827765960278","0.8683417085427135","1","Intel(R) Xeon(R) Platinum 8570","2","56","NVIDIA B200-SXM-180GB","8","8","./open/Lambda/results/B200-SXM-180GBx8_SGLANG/qwen3.6-27b/SingleStream/performance/run_1","SGLang 0.5.15.post1, CUDA 13.0","Ubuntu 24.04.4 LTS","8x B200-SXM-180GB (Blackwell). OPEN division. Model = moonshotai/Kimi-K2.6 (kimi_k25, fp8), served with SGLang TP=8 on 8x B200, reasoning disabled (chat_template thinking=false, the reference 'reasoning off' analog). Workload = the MLPerf edge-agentic reference (mlcommons/endpoints example 11_Edge_Agentic_Example): BFCL v4 single-turn function-calling accuracy + agentic-coding inline-checker performance replay, all reference invariants unchanged (temperature 0, max_new_tokens 1024, single-stream). Benchmark labeled kimi-k2.6-edge-agentic. All metrics are Kimi-K2.6's real measured numbers.","open","0","v6.1","1","False","Latency (ms)","fp8","None","" "Orrick Industries LLC","rdi","open","datacenter","Orrick Optimized 6x NVIDIA B200","b200_6x","llama3.1-8b","llama3.1-8b","Offline","274927.0","ROUGE1: 36.869 ROUGE2: 14.1535 ROUGEL: 23.5033 ROUGELSUM: 33.7502","1","INTEL(R) XEON(R) PLATINUM 8568Y+","2","48","NVIDIA B200-SXM-180GB","6","6","./open/Orrick Industries LLC/results/b200_6x/llama3.1-8b/Offline/performance/run_1","TensorRT-LLM 1.3.0rc20","Ubuntu 24.04.3 LTS (container)","6x NVIDIA B200, rented cloud instance. Orrick proprietary inference optimization. NVFP4 weights with FP8 KV cache. Implementation details are proprietary and not disclosed.","open","0","v6.1","0","False","Tokens/s","nvfp4","None","" "Orrick Industries LLC","rdi","open","datacenter","Orrick Optimized 6x NVIDIA B200 L2","b200_l2_6x","llama2-70b-99.9","llama2-70b-99.9","Offline","130928.0","ROUGE1: 41.797 ROUGE2: 19.7311 ROUGEL: 26.6864 TOKENS_PER_SAMPLE: 281.9","1","INTEL(R) XEON(R) PLATINUM 8568Y+","2","48","NVIDIA B200-SXM-180GB","6","6","./open/Orrick Industries LLC/results/b200_l2_6x/llama2-70b-99.9/Offline/performance/run_1","TensorRT-LLM 1.3.0rc20","Ubuntu 24.04.3 LTS (container)","6x NVIDIA B200, rented cloud instance. Orrick proprietary inference optimization. NVFP4 weights with FP8 KV cache. Implementation details are proprietary and not disclosed.","open","0","v6.1","0","False","Tokens/s","nvfp4","None","" "ScitiX","available","open","datacenter","ScitiX B200 (8x B200-SXM-180GB, TensorRT-LLM)","B200-SXM-180GBx8_TRT","deepseek-r1","deepseek-r1","Offline","60410.9","exact_match: 81.70009115770283 TOKENS_PER_SAMPLE: 3727.5230173199634","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B200-SXM-180GB","8","8","./open/ScitiX/results/B200-SXM-180GBx8_TRT/deepseek-r1/Offline/performance/run_1","TensorRT-LLM 1.3.0rc0, CUDA 13.1","Ubuntu 24.04.3 LTS","Closed division; DeepSeek-R1 NVFP4 weights + FP8 KV; aggregated 8-GPU TP=8 with MTP (num_nextn_predict_layers=1) speculative decoding","open","0","v6.1","0","False","Tokens/s","fp4","None","" "ScitiX","available","open","datacenter","ScitiX B200 (8x B200-SXM-180GB, TensorRT-LLM)","B200-SXM-180GBx8_TRT","deepseek-r1","deepseek-r1","Server","59668.3","exact_match: 81.17593436645396 TOKENS_PER_SAMPLE: 3739.3393345487693","1","Intel(R) Xeon(R) 6767P","2","64","NVIDIA B200-SXM-180GB","8","8","./open/ScitiX/results/B200-SXM-180GBx8_TRT/deepseek-r1/Server/performance/run_1","TensorRT-LLM 1.3.0rc0, CUDA 13.1","Ubuntu 24.04.3 LTS","Closed division; DeepSeek-R1 NVFP4 weights + FP8 KV; aggregated 8-GPU TP=8 with MTP (num_nextn_predict_layers=1) speculative decoding","open","0","v6.1","0","False","Tokens/s","fp4","None",""