{ "0":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI350X_2xEPYC_9575F", "Platform":"8xMI350X_2xEPYC_9575F", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Offline", "Result":10891.1, "Accuracy":"DLRM_NE: 0.8677294228203597 DLRM_ACC: 0.6964170290002015 DLRM_AUC: 0.7862871466027813", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI350X_2xEPYC_9575F\/dlrm-v3\/Offline\/performance\/run_1", "framework":"PyTorch 2.10.0+rocm7.2.3, Triton 3.6.0, ROCm 7.2.3", "operating_system":"Ubuntu 24.04 LTS (Noble Numbat), kernel 6.8.0-38-generic", "notes":"Measured on host smci350-rck-g03-d13-31: 8x AMD Instinct MI350X \/ 2x AMD EPYC 9575F (64 cores\/socket, 2 sockets). Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm b32 q7,250 GOLD stack (full-causal, C1-off) with degree-5 production gate and TEST08 determinism fixes; container dlrmv3-e2e723 (ROCm 7.2.3).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16,bf16,fp8", "design_power_watts":null, "PrivateID":null }, "1":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI350X_2xEPYC_9575F", "Platform":"8xMI350X_2xEPYC_9575F", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Server", "Result":9297.78, "Accuracy":"DLRM_NE: 0.867728327062296 DLRM_ACC: 0.696416918732384 DLRM_AUC: 0.786287540637186", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI350X_2xEPYC_9575F\/dlrm-v3\/Server\/performance\/run_1", "framework":"PyTorch 2.10.0+rocm7.2.3, Triton 3.6.0, ROCm 7.2.3", "operating_system":"Ubuntu 24.04 LTS (Noble Numbat), kernel 6.8.0-38-generic", "notes":"Measured on host smci350-rck-g03-d13-31: 8x AMD Instinct MI350X \/ 2x AMD EPYC 9575F (64 cores\/socket, 2 sockets). Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm b32 q7,250 GOLD stack (full-causal, C1-off) with degree-5 production gate and TEST08 determinism fixes; container dlrmv3-e2e723 (ROCm 7.2.3).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Queries\/s", "weight_data_types":"fp16,bf16,fp8", "design_power_watts":null, "PrivateID":null }, "2":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Quanta Grand Teton 1.5 MI350", "Platform":"8xMI350X_2xEPYC_9655", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0565013, "Accuracy":"vbench_score: 70.1221", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI350X_2xEPYC_9655\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"xDiT, xfuser 0.4.5, PyTorch 2.9.1+gitff65f5b, ROCm 7.13.0", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "3":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Quanta Grand Teton 1.5 MI350", "Platform":"8xMI350X_2xEPYC_9655", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":20.603024726, "Accuracy":"vbench_score: 70.1582", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI350X_2xEPYC_9655\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"xDiT, xfuser 0.4.5, PyTorch 2.9.1+gitff65f5b, ROCm 7.13.0", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Latency (s)", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "4":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Offline", "Result":13027.7, "Accuracy":"DLRM_NE: 0.8681176645656181 DLRM_ACC: 0.6963383089448092 DLRM_AUC: 0.7862169525257562", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/dlrm-v3\/Offline\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16,bf16,fp8", "design_power_watts":null, "PrivateID":null }, "5":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Server", "Result":12198.8, "Accuracy":"DLRM_NE: 0.8681164332983042 DLRM_ACC: 0.696331698458935 DLRM_AUC: 0.786212286822123", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/dlrm-v3\/Server\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Queries\/s", "weight_data_types":"fp16,bf16,fp8", "design_power_watts":null, "PrivateID":null }, "6":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":121818.0, "Accuracy":"exact_match: 83.706", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "7":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":113241.0, "Accuracy":"exact_match: 83.451", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "8":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":73191.5, "Accuracy":"ROUGE1: 44.5125 ROUGE2: 22.1593 ROUGEL: 28.9205 TOKENS_PER_SAMPLE: 284.1", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "9":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":106517.0, "Accuracy":"ROUGE1: 44.5481 ROUGE2: 22.1846 ROUGEL: 28.9482 TOKENS_PER_SAMPLE: 283.2", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "10":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":103275.0, "Accuracy":"ROUGE1: 44.5266 ROUGE2: 22.1733 ROUGEL: 28.9289 TOKENS_PER_SAMPLE: 284.2", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "11":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0731282, "Accuracy":"vbench_score: 69.8899", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "12":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"smci355-ccs-aus-m13-13 (AS -4126GS-NMR-LCC)", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":16.124484197, "Accuracy":"vbench_score: 69.9691", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":8, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/AMD\/results\/8xMI355X_2xEPYC_9575F\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"PyTorch 2.10.0+git8514f05, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Latency (s)", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "13":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"9x8xMI355X_2xEPYC_9575F", "Platform":"9x8xMI355X_2xEPYC_9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":1039900.0, "Accuracy":"exact_match: 83.230", "number_of_nodes":9, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":72, "Location":".\/closed\/AMD\/results\/9x8xMI355X_2xEPYC_9575F\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.1.dev0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"9 nodes x 8 AMD Instinct MI355X (gfx950) = 72 GPUs, 288GB HBM3E each; distributed asynchronous ZMQ backend. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization; 72-GPU distributed ZMQ (async server \/ sync offline)", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "14":{ "Organization":"AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"9x8xMI355X_2xEPYC_9575F", "Platform":"9x8xMI355X_2xEPYC_9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":964468.0, "Accuracy":"exact_match: 83.446", "number_of_nodes":9, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":72, "Location":".\/closed\/AMD\/results\/9x8xMI355X_2xEPYC_9575F\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.1.dev0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"9 nodes x 8 AMD Instinct MI355X (gfx950) = 72 GPUs, 288GB HBM3E each; distributed asynchronous ZMQ backend. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization; 72-GPU distributed ZMQ (async server \/ sync offline)", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "15":{ "Organization":"ASUSTeK", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XA NB3I-E12", "Platform":"XA_NB3I-E12_B300x8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":69846.9, "Accuracy":"exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3759.735870556062", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/ASUSTeK\/results\/XA_NB3I-E12_B300x8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "16":{ "Organization":"ASUSTeK", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XA NB3I-E12", "Platform":"XA_NB3I-E12_B300x8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":54568.6, "Accuracy":"exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3802.827256153145", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/ASUSTeK\/results\/XA_NB3I-E12_B300x8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "17":{ "Organization":"ASUSTeK", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XA NB3I-E12", "Platform":"XA_NB3I-E12_B300x8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":109368.0, "Accuracy":"exact_match: 83.572", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/ASUSTeK\/results\/XA_NB3I-E12_B300x8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "18":{ "Organization":"ASUSTeK", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XA NB3I-E12", "Platform":"XA_NB3I-E12_B300x8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":109949.0, "Accuracy":"exact_match: 83.403", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/ASUSTeK\/results\/XA_NB3I-E12_B300x8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "19":{ "Organization":"ASUSTeK", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XA NB3I-E12", "Platform":"XA_NB3I-E12_B300x8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":113007.0, "Accuracy":"ROUGE1: 44.7974 ROUGE2: 22.3739 ROUGEL: 29.1541 TOKENS_PER_SAMPLE: 272.7", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/ASUSTeK\/results\/XA_NB3I-E12_B300x8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "20":{ "Organization":"ASUSTeK", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XA NB3I-E12", "Platform":"XA_NB3I-E12_B300x8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":113455.0, "Accuracy":"ROUGE1: 44.8853 ROUGE2: 22.409 ROUGEL: 29.2169 TOKENS_PER_SAMPLE: 272.2", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/ASUSTeK\/results\/XA_NB3I-E12_B300x8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "21":{ "Organization":"Atlas_Inference", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"NVIDIA DGX Spark (GB10 Grace Blackwell Superchip)", "Platform":"DGX_Spark_GB10", "Model":"qwen3.6-27b", "MlperfModel":"agentic edge", "Scenario":"SingleStream", "Result":3807.6635113615, "Accuracy":"0.8723618090452261", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace (20-core Arm v9.2)", "host_processors_per_node":1, "host_processor_core_count":"20", "accelerator_model_name":"NVIDIA GB10", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Atlas_Inference\/results\/DGX_Spark_GB10\/qwen3.6-27b\/SingleStream\/performance\/run_1", "framework":"Atlas (spark), CUDA NVFP4", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"NVIDIA DGX Spark GB10 Grace Blackwell Superchip with 128 GB unified LPDDR5X memory (~273 GB\/s) shared between the Grace CPU and the GB10 GPU; roughly 119-121 GiB of that is reportable to the OS as usable. GB10 GPU is Blackwell, sm_121a \/ compute capability 12.1.. Atlas NVFP4 serve; chain-widened MTP verify K=4 (3 drafts) + drafter context prefill\/carry; GDN register-resident warm-replay (ATLAS_GDN_REGRESIDENT, merged default-on upstream as 063d87ee); see results\/...\/README.md.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"nvfp4 (E2M1 4-bit + FP8 block scales), GDN included", "design_power_watts":null, "PrivateID":null }, "22":{ "Organization":"Atlas_Inference", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"AMD Strix Halo desktop (Ryzen AI Max+ 395 \/ Radeon 8060S)", "Platform":"Strix_Halo", "Model":"qwen3.6-27b", "MlperfModel":"agentic edge", "Scenario":"SingleStream", "Result":7058.9891996852, "Accuracy":"0.8623115577889447", "number_of_nodes":1, "host_processor_model_name":"AMD Ryzen AI Max+ 395", "host_processors_per_node":1, "host_processor_core_count":"16", "accelerator_model_name":"AMD Radeon 8060S Graphics", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Atlas_Inference\/results\/Strix_Halo\/qwen3.6-27b\/SingleStream\/performance\/run_1", "framework":"Atlas (spark), native-HIP NVFP4", "operating_system":"Ubuntu 24.04 (Linux), ROCm 7.13", "notes":"AMD Strix Halo APU (Ryzen AI Max+ 395) with 128 GB unified LPDDR5X memory shared between the CPU and the integrated GPU; ~62.5 GB of that is GPU-addressable via GTT. Radeon 8060S Graphics is gfx1151, RDNA3.5.. Atlas NVFP4 native-HIP serve; MTP K=3 (2 drafts) + drafter context-prefill; see results\/...\/README.md.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"nvfp4 (E2M1 4-bit + FP8 block scales)", "design_power_watts":null, "PrivateID":null }, "23":{ "Organization":"Azure", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Azure GB200 NVL72 (288x GB200-186GB_aarch64, TensorRT)", "Platform":"Azure-GB200-NVL72_186GBx288", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":2091190.0, "Accuracy":"exact_match: 81.56335460346399 TOKENS_PER_SAMPLE: 3758.743163172288", "number_of_nodes":72, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":288, "Location":".\/closed\/Azure\/results\/Azure-GB200-NVL72_186GBx288\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "24":{ "Organization":"Azure", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Azure GB200 NVL72 (288x GB200-186GB_aarch64, TensorRT)", "Platform":"Azure-GB200-NVL72_186GBx288", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":1598510.0, "Accuracy":"exact_match: 80.85688240656336 TOKENS_PER_SAMPLE: 3746.623518687329", "number_of_nodes":72, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":288, "Location":".\/closed\/Azure\/results\/Azure-GB200-NVL72_186GBx288\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "25":{ "Organization":"Azure", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Azure GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"Azure-GB200-NVL72_186GBx72", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":542075.0, "Accuracy":"exact_match: 81.35824977210574 TOKENS_PER_SAMPLE: 3739.669553327256", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Azure\/results\/Azure-GB200-NVL72_186GBx72\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "26":{ "Organization":"Azure", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Azure GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"Azure-GB200-NVL72_186GBx72", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":426796.0, "Accuracy":"exact_match: 81.51777575205105 TOKENS_PER_SAMPLE: 3732.908158614403", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Azure\/results\/Azure-GB200-NVL72_186GBx72\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "27":{ "Organization":"Azure", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Azure GB300 NVL72 (72x GB300-288GB_aarch64 TensorRT)", "Platform":"Azure-GB300-NVL72_288GBx72", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Interactive", "Result":260098.0, "Accuracy":"exact_match: 80.81130355515042 TOKENS_PER_SAMPLE: 3720.641750227894", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Azure\/results\/Azure-GB300-NVL72_288GBx72\/deepseek-r1\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "28":{ "Organization":"Azure", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Azure GB300 NVL72 (72x GB300-288GB_aarch64 TensorRT)", "Platform":"Azure-GB300-NVL72_288GBx72", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":661143.0, "Accuracy":"exact_match: 81.47219690063811 TOKENS_PER_SAMPLE: 3779.8644029170464", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Azure\/results\/Azure-GB300-NVL72_288GBx72\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "29":{ "Organization":"Azure", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Azure GB300 NVL72 (72x GB300-288GB_aarch64 TensorRT)", "Platform":"Azure-GB300-NVL72_288GBx72", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":589391.0, "Accuracy":"exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3771.7791704649044", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Azure\/results\/Azure-GB300-NVL72_288GBx72\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "30":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C240M8_RTXPro4500_32GBx5_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":8494.68, "Accuracy":"ROUGE1: 38.7733 ROUGE2: 16.0169 ROUGEL: 24.5358 ROUGELSUM: 35.6947 GEN_LEN: 8179270", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":5, "total_accelerators":5, "Location":".\/closed\/Cisco\/results\/C240M8_RTXPro4500_32GBx5_TRT\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "31":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C240M8_RTXPro4500_32GBx5_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":12017.7, "Accuracy":"ROUGE1: 38.7698 ROUGE2: 16.0132 ROUGEL: 24.5304 ROUGELSUM: 35.6924 GEN_LEN: 8178850", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":5, "total_accelerators":5, "Location":".\/closed\/Cisco\/results\/C240M8_RTXPro4500_32GBx5_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "32":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C240M8_RTXPro4500_32GBx5_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":11426.1, "Accuracy":"ROUGE1: 38.7615 ROUGE2: 16.0056 ROUGEL: 24.5235 ROUGELSUM: 35.6866 GEN_LEN: 8178120", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":5, "total_accelerators":5, "Location":".\/closed\/Cisco\/results\/C240M8_RTXPro4500_32GBx5_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "33":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C240 M8 - (5x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C240M8_RTXPro4500_32GBx5_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":4808.98, "Accuracy":"ACCURACY: 97.83682442399383", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":5, "total_accelerators":5, "Location":".\/closed\/Cisco\/results\/C240M8_RTXPro4500_32GBx5_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "34":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C845A_M8_RTXPro4500_32GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":14316.2, "Accuracy":"ROUGE1: 38.7705 ROUGE2: 16.0134 ROUGEL: 24.5326 ROUGELSUM: 35.6934 GEN_LEN: 8179270", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro4500_32GBx8_TRT\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "35":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C845A_M8_RTXPro4500_32GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":18800.9, "Accuracy":"ROUGE1: 38.7819 ROUGE2: 16.0194 ROUGEL: 24.5377 ROUGELSUM: 35.7086 GEN_LEN: 8178827", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro4500_32GBx8_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "36":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C845A_M8_RTXPro4500_32GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":18186.2, "Accuracy":"ROUGE1: 38.7633 ROUGE2: 16.0118 ROUGEL: 24.5232 ROUGELSUM: 35.6834 GEN_LEN: 8178277", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro4500_32GBx8_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "37":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"C845A_M8_RTXPro4500_32GBx8_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":7777.66, "Accuracy":"ACCURACY: 97.82825927653055", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro4500_32GBx8_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "38":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":15508.4, "Accuracy":"exact_match: 83.570", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "39":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":14817.4, "Accuracy":"exact_match: 84.117", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "40":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":29904.0, "Accuracy":"ROUGE1: 44.7661 ROUGE2: 22.3346 ROUGEL: 29.1319 TOKENS_PER_SAMPLE: 274.4", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "41":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":29316.4, "Accuracy":"ROUGE1: 44.7625 ROUGE2: 22.3336 ROUGEL: 29.1052 TOKENS_PER_SAMPLE: 273.5", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "42":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":46164.4, "Accuracy":"ROUGE1: 38.7602 ROUGE2: 15.9962 ROUGEL: 24.5347 ROUGELSUM: 35.6851 GEN_LEN: 8180275", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "43":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":50453.7, "Accuracy":"ROUGE1: 38.769 ROUGE2: 16.0147 ROUGEL: 24.5312 ROUGELSUM: 35.6942 GEN_LEN: 8178808", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "44":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":49174.7, "Accuracy":"ROUGE1: 38.7598 ROUGE2: 16.0015 ROUGEL: 24.5351 ROUGELSUM: 35.6872 GEN_LEN: 8179087", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "45":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C845A M8 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"C845A_M8_RTXPro6000_96GBx8_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":18991.8, "Accuracy":"ACCURACY: 97.8425345223027", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C845A_M8_RTXPro6000_96GBx8_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "46":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":70325.4, "Accuracy":"exact_match: 80.92525068368278 TOKENS_PER_SAMPLE: 3782.986326344576", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "47":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":66171.6, "Accuracy":"exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3811.0783956244304", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "48":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":129168.0, "Accuracy":"ROUGE1: 38.4828 ROUGE2: 15.9176 ROUGEL: 24.3231 ROUGELSUM: 35.6535 GEN_LEN: 8186168", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "49":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":171114.0, "Accuracy":"ROUGE1: 38.4898 ROUGE2: 15.9329 ROUGEL: 24.3413 ROUGELSUM: 35.6705 GEN_LEN: 8186559", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "50":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":173950.0, "Accuracy":"ROUGE1: 38.4912 ROUGE2: 15.9156 ROUGEL: 24.3266 ROUGELSUM: 35.6593 GEN_LEN: 8186471", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "51":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0612749683, "Accuracy":"0.7028246725986534", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "52":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":20.004214518, "Accuracy":"0.6994130989447821", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "53":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS C880A M8 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"C880A_M8_B300_270GBx8_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":52221.8, "Accuracy":"ACCURACY: 97.8263559104276", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Cisco\/results\/C880A_M8_B300_270GBx8_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "54":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco_UCS_B300x16_G200_4x2_RO", "Platform":"Cisco_UCS_B300x16_G200_4x2_RO", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":137067.0, "Accuracy":"exact_match: 81.33546034639927 TOKENS_PER_SAMPLE: 3825.4619416590704", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_B300x16_G200_4x2_RO\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "55":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco_UCS_B300x16_G200_4x2_RO", "Platform":"Cisco_UCS_B300x16_G200_4x2_RO", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":88915.5, "Accuracy":"exact_match: 81.28988149498633 TOKENS_PER_SAMPLE: 3794.9457611668186", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_B300x16_G200_4x2_RO\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "56":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco_UCS_B300x16_G200_4x2_RO", "Platform":"Cisco_UCS_B300x16_G200_4x2_RO", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":220527.0, "Accuracy":"exact_match: 83.296", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_B300x16_G200_4x2_RO\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "57":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco_UCS_B300x16_G200_4x2_RO", "Platform":"Cisco_UCS_B300x16_G200_4x2_RO", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":214774.0, "Accuracy":"exact_match: 83.572", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_B300x16_G200_4x2_RO\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "58":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco_UCS_B300x16_G200_4x2_RO", "Platform":"Cisco_UCS_B300x16_G200_4x2_RO", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":227570.0, "Accuracy":"ROUGE1: 44.8082 ROUGE2: 22.3989 ROUGEL: 29.1755 TOKENS_PER_SAMPLE: 272.1", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_B300x16_G200_4x2_RO\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "59":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco_UCS_B300x16_G200_4x2_RO", "Platform":"Cisco_UCS_B300x16_G200_4x2_RO", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":179597.0, "Accuracy":"ROUGE1: 44.7969 ROUGE2: 22.3691 ROUGEL: 29.184 TOKENS_PER_SAMPLE: 272.7", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_B300x16_G200_4x2_RO\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14.1.48; TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.17.0-35-generic", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "60":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":94249.3, "Accuracy":"exact_match: 83.57105741751104", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "61":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":73357.6, "Accuracy":"exact_match: 83.43465835281891", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "62":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":70354.5, "Accuracy":"ROUGE1: 44.5557 ROUGE2: 22.154 ROUGEL: 28.907 TOKENS_PER_SAMPLE: 283.6", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8,fp4", "design_power_watts":null, "PrivateID":null }, "63":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":99683.8, "Accuracy":"ROUGE1: 44.4169 ROUGE2: 22.068 ROUGEL: 28.7957 TOKENS_PER_SAMPLE: 286.6", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8,fp4", "design_power_watts":null, "PrivateID":null }, "64":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":95104.6, "Accuracy":"ROUGE1: 44.6044 ROUGE2: 22.1926 ROUGEL: 28.9466 TOKENS_PER_SAMPLE: 284.7", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8,fp4", "design_power_watts":null, "PrivateID":null }, "65":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":121557.0, "Accuracy":"ROUGE1: 38.6105 ROUGE2: 16.0699 ROUGEL: 24.5048 ROUGELSUM: 35.5444 GEN_LEN: 8148492", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8,fp4", "design_power_watts":null, "PrivateID":null }, "66":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":163292.0, "Accuracy":"ROUGE1: 38.5675 ROUGE2: 16.0757 ROUGEL: 24.5063 ROUGELSUM: 35.5154 GEN_LEN: 8141814", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8,fp4", "design_power_watts":null, "PrivateID":null }, "67":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS H200 x8 + MI350X x8 G200 2x2 TOR", "Platform":"Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":161110.0, "Accuracy":"ROUGE1: 38.6437 ROUGE2: 16.1045 ROUGEL: 24.5278 ROUGELSUM: 35.5601 GEN_LEN: 8147699", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"NVIDIA H200-SXM-141GB + AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/Cisco\/results\/Cisco_UCS_H200x8_MI350Xx8_G200_2x2_TOR\/llama3.1-8b\/Server\/performance\/run_1", "framework":"vLLM", "operating_system":"Ubuntu 22.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8,fp4", "design_power_watts":null, "PrivateID":null }, "68":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro4500_32GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":6883.94, "Accuracy":"ROUGE1: 38.7575 ROUGE2: 16.0054 ROUGEL: 24.5233 ROUGELSUM: 35.6829 GEN_LEN: 8179124", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro4500_32GBx4_TRT\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "69":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro4500_32GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":9518.66, "Accuracy":"ROUGE1: 38.7664 ROUGE2: 16.0107 ROUGEL: 24.5281 ROUGELSUM: 35.6917 GEN_LEN: 8178365", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro4500_32GBx4_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "70":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro4500_32GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":9277.73, "Accuracy":"ROUGE1: 38.7836 ROUGE2: 16.0298 ROUGEL: 24.5367 ROUGELSUM: 35.7048 GEN_LEN: 8178628", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro4500_32GBx4_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "71":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210 M8 - X580P PCIe Node (4x NVIDIA RTX PRO 4500 Blackwell-32GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro4500_32GBx4_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":3877.67, "Accuracy":"ACCURACY: 97.86822996469256", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro4500_32GBx4_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "72":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":7801.36, "Accuracy":"exact_match: 83.969", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro6000_96GBx4_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "73":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":6950.76, "Accuracy":"exact_match: 83.637", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro6000_96GBx4_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "74":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":14860.7, "Accuracy":"ROUGE1: 44.7766 ROUGE2: 22.3407 ROUGEL: 29.1379 TOKENS_PER_SAMPLE: 275.2", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro6000_96GBx4_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "75":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X210c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X210M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":14333.3, "Accuracy":"ROUGE1: 44.7151 ROUGE2: 22.3389 ROUGEL: 29.0874 TOKENS_PER_SAMPLE: 274.6", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X210M8_X580P_RTXPro6000_96GBx4_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "76":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X215M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":22447.0, "Accuracy":"ROUGE1: 38.7706 ROUGE2: 16.012 ROUGEL: 24.5423 ROUGELSUM: 35.699 GEN_LEN: 8179184", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9845", "host_processors_per_node":2, "host_processor_core_count":"160", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X215M8_X580P_RTXPro6000_96GBx4_TRT\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "77":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X215M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":24913.5, "Accuracy":"ROUGE1: 38.7701 ROUGE2: 16.0155 ROUGEL: 24.534 ROUGELSUM: 35.6954 GEN_LEN: 8178898", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9845", "host_processors_per_node":2, "host_processor_core_count":"160", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X215M8_X580P_RTXPro6000_96GBx4_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "78":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X215M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":24498.6, "Accuracy":"ROUGE1: 38.766 ROUGE2: 16.0082 ROUGEL: 24.5262 ROUGELSUM: 35.6898 GEN_LEN: 8179590", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9845", "host_processors_per_node":2, "host_processor_core_count":"160", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X215M8_X580P_RTXPro6000_96GBx4_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "79":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Cisco UCS X215c M8 - X580P PCIe Node (4x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"X215M8_X580P_RTXPro6000_96GBx4_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":9236.94, "Accuracy":"ACCURACY: 97.8339693748394", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9845", "host_processors_per_node":2, "host_processor_core_count":"160", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Cisco\/results\/X215M8_X580P_RTXPro6000_96GBx4_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "80":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"X410M8_1_node_4S_GNR_86C", "Platform":"X410M8_1_node_4S_GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":2068.63, "Accuracy":"ROUGE1: 38.6284 ROUGE2: 15.804 ROUGEL: 24.4033 ROUGELSUM: 35.6616 GEN_LEN: 8196513", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":4, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Cisco\/results\/X410M8_1_node_4S_GNR_86C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "81":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"X410M8_1_node_4S_GNR_86C", "Platform":"X410M8_1_node_4S_GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":1030.45, "Accuracy":"ROUGE1: 38.8382 ROUGE2: 16.0493 ROUGEL: 24.6331 ROUGELSUM: 35.8769 GEN_LEN: 8171982", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":4, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Cisco\/results\/X410M8_1_node_4S_GNR_86C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "82":{ "Organization":"Cisco", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"X410M8_1_node_4S_GNR_86C", "Platform":"X410M8_1_node_4S_GNR_86C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":2970.57, "Accuracy":"ACCURACY: 97.94665880091725", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":4, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Cisco\/results\/X410M8_1_node_4S_GNR_86C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "83":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B200 SXM (8x B200-SXM-180GB)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":58913.2, "Accuracy":"exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3888.048541476755", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8562Y+", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B200-SXM-180GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "84":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B200 SXM (8x B200-SXM-180GB)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":56121.3, "Accuracy":"exact_match: 81.60893345487693 TOKENS_PER_SAMPLE: 3816.3475387420235", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8562Y+", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B200-SXM-180GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "85":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B200 SXM (8x B200-SXM-180GB)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":91487.4, "Accuracy":"exact_match: 83.901", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8562Y+", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B200-SXM-180GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "86":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B200 SXM (8x B200-SXM-180GB)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":90204.7, "Accuracy":"exact_match: 83.728", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8562Y+", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B200-SXM-180GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "87":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B200 SXM (8x B200-SXM-180GB)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":102703.0, "Accuracy":"ROUGE1: 44.833 ROUGE2: 22.4096 ROUGEL: 29.2097 TOKENS_PER_SAMPLE: 271.6", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8562Y+", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B200-SXM-180GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "88":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B200 SXM (8x B200-SXM-180GB)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":102398.0, "Accuracy":"ROUGE1: 44.8305 ROUGE2: 22.4096 ROUGEL: 29.21 TOKENS_PER_SAMPLE: 271.5", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8562Y+", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B200-SXM-180GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "89":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B300 SXM (8x B300-SXM-270GB)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":112840.0, "Accuracy":"exact_match: 83.290", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "90":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B300 SXM (8x B300-SXM-270GB)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":111247.0, "Accuracy":"exact_match: 83.467", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "91":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B300 SXM (8x B300-SXM-270GB)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":115530.0, "Accuracy":"ROUGE1: 44.7888 ROUGE2: 22.3737 ROUGEL: 29.1521 TOKENS_PER_SAMPLE: 272.9", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "92":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave B300 SXM (8x B300-SXM-270GB)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":114576.0, "Accuracy":"ROUGE1: 44.8422 ROUGE2: 22.4119 ROUGEL: 29.1975 TOKENS_PER_SAMPLE: 272.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/CoreWeave\/results\/B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "93":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":529991.0, "Accuracy":"exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3815.436645396536", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"GB200 TGP 1200W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "94":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":419778.0, "Accuracy":"exact_match: 81.03919781221514 TOKENS_PER_SAMPLE: 3802.557201458523", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"GB200 TGP 1200W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "95":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":911566.0, "Accuracy":"exact_match: 83.394", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"GB200 TGP 1200W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "96":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":901058.0, "Accuracy":"exact_match: 83.424", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"GB200 TGP 1200W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "97":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":894002.0, "Accuracy":"ROUGE1: 44.8296 ROUGE2: 22.4099 ROUGEL: 29.2105 TOKENS_PER_SAMPLE: 271.5", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"GB200 TGP 1200W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "98":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB200 NVL72 (72x GB200-186GB_aarch64)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":910621.0, "Accuracy":"ROUGE1: 44.8247 ROUGE2: 22.3971 ROUGEL: 29.2015 TOKENS_PER_SAMPLE: 271.7", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"GB200 TGP 1200W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "99":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (4x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":72.598002941, "Accuracy":"0.7873886028433235", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"vLLM CentML:mlperf-inf-mm-q3vl-v6.0, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"Single 4-GPU GB300 node, TGP 1400W per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp4 weights, fp8 KV cache", "design_power_watts":null, "PrivateID":null }, "100":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (4x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":64.1320203068, "Accuracy":"0.7880294101448477", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"vLLM CentML:mlperf-inf-mm-q3vl-v6.0, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0", "operating_system":"Ubuntu 24.04", "notes":"Single 4-GPU GB300 node, TGP 1400W per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"fp4 weights, fp8 KV cache", "design_power_watts":null, "PrivateID":null }, "101":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":1197710.0, "Accuracy":"exact_match: 83.098", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"GB300 TGP 1400W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "102":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":1160490.0, "Accuracy":"exact_match: 82.875", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"GB300 TGP 1400W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "103":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":1136100.0, "Accuracy":"ROUGE1: 44.8147 ROUGE2: 22.3736 ROUGEL: 29.189 TOKENS_PER_SAMPLE: 272.4", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"GB300 TGP 1400W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "104":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":944902.0, "Accuracy":"ROUGE1: 44.8524 ROUGE2: 22.4096 ROUGEL: 29.218 TOKENS_PER_SAMPLE: 272.3", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"GB300 TGP 1400W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "105":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":1135.2500157944, "Accuracy":"0.78717027204421", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"GB300 TGP 1400W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp4 weights, fp8 KV cache", "design_power_watts":null, "PrivateID":null }, "106":{ "Organization":"CoreWeave", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"CoreWeave GB300 NVL72 (72x GB300-288GB_aarch64)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":1195.5907586338, "Accuracy":"0.7875410543420632", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace (Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/CoreWeave\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"GB300 TGP 1400W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"fp4 weights, fp8 KV cache", "design_power_watts":null, "PrivateID":null }, "107":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Crusoe Cloud 64x8 MI355X (512 GPU) \u2014 DeepSeek-R1 \/ SGLang", "Platform":"512xMI355X_Crusoe_DS", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":2901950.0, "Accuracy":"exact_match: 80.69735642661804 TOKENS_PER_SAMPLE: 3898.373746581586", "number_of_nodes":64, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":512, "Location":".\/closed\/Crusoe\/results\/512xMI355X_Crusoe_DS\/deepseek-r1\/Offline\/performance\/run_1", "framework":"SGLang 0.5.15.post1 (ROCm 7.2.0), PyTorch 2.x", "operating_system":"Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.0 userspace)", "notes":"Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU DeepSeek-R1 (Offline + Server).. AMD MLPerf Inference v6.1 DeepSeek-R1 harness (SGLang backend). Model amd\/Deepseek-S3_sq_a05_v2_mlperf6_1 \u2014 MXFP4 experts \/ FP8 KV cache \/ BF16 MLA-absorb. Per node TP8 \/ EP8 \/ DP-attention8 \/ PP1 (one 8-GPU replica); device_count=512. Server uses engine warmup (dsr_code6_1 WarmUp.ENCODED_SAMPLES) + prefill-delayer for TTFT\/TPOT.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "108":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Crusoe Cloud 64x8 MI355X (512 GPU) \u2014 DeepSeek-R1 \/ SGLang", "Platform":"512xMI355X_Crusoe_DS", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":2405310.0, "Accuracy":"exact_match: 80.69735642661804 TOKENS_PER_SAMPLE: 3898.373746581586", "number_of_nodes":64, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":512, "Location":".\/closed\/Crusoe\/results\/512xMI355X_Crusoe_DS\/deepseek-r1\/Server\/performance\/run_1", "framework":"SGLang 0.5.15.post1 (ROCm 7.2.0), PyTorch 2.x", "operating_system":"Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.0 userspace)", "notes":"Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU DeepSeek-R1 (Offline + Server).. AMD MLPerf Inference v6.1 DeepSeek-R1 harness (SGLang backend). Model amd\/Deepseek-S3_sq_a05_v2_mlperf6_1 \u2014 MXFP4 experts \/ FP8 KV cache \/ BF16 MLA-absorb. Per node TP8 \/ EP8 \/ DP-attention8 \/ PP1 (one 8-GPU replica); device_count=512. Server uses engine warmup (dsr_code6_1 WarmUp.ENCODED_SAMPLES) + prefill-delayer for TTFT\/TPOT.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "109":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Crusoe Cloud 64x8 MI355X (512 GPU) \u2014 gpt-oss-120b \/ vLLM", "Platform":"512xMI355X_Crusoe_GPT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":5749440.0, "Accuracy":"exact_match: 83.706", "number_of_nodes":64, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":512, "Location":".\/closed\/Crusoe\/results\/512xMI355X_Crusoe_GPT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.1 (ROCm 7.2.2), PyTorch 2.10", "operating_system":"Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.2 userspace)", "notes":"Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU gpt-oss-120b (Offline + Server).. AMD MLPerf Inference v6.1 gpt-oss-120b harness (vLLM backend). Native-MXFP4 model openai\/gpt-oss-120b@b5c939d (NOT the v6.0 Quark repack). tensor_parallel_size=1 (one GPU per replica, 8 replicas\/node); device_count=512. Dedicated ZMQ head dispatches Offline sample-ranges \/ Server per-query and relays token streams.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "110":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Crusoe Cloud 64x8 MI355X (512 GPU) \u2014 gpt-oss-120b \/ vLLM", "Platform":"512xMI355X_Crusoe_GPT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":5392930.0, "Accuracy":"exact_match: 83.706", "number_of_nodes":64, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":512, "Location":".\/closed\/Crusoe\/results\/512xMI355X_Crusoe_GPT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.1 (ROCm 7.2.2), PyTorch 2.10", "operating_system":"Ubuntu 24.04 (node amdgpu driver 6.14.x; container ROCm 7.2.2 userspace)", "notes":"Crusoe Cloud mi355x-288gb-roce.8x, 64 nodes = 512 MI355X GPUs. First-ever 512-GPU gpt-oss-120b (Offline + Server).. AMD MLPerf Inference v6.1 gpt-oss-120b harness (vLLM backend). Native-MXFP4 model openai\/gpt-oss-120b@b5c939d (NOT the v6.0 Quark repack). tensor_parallel_size=1 (one GPU per replica, 8 replicas\/node); device_count=512. Dedicated ZMQ head dispatches Offline sample-ranges \/ Server per-query and relays token streams.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "111":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (16x GB200-186GB_aarch64, Dynamo)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x16_Dynamo", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":39.8507913343, "Accuracy":"0.7860671731639475", "number_of_nodes":4, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":16, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x16_Dynamo\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4, FP8 (KV cache)", "design_power_watts":null, "PrivateID":null }, "112":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (16x GB200-186GB_aarch64, Dynamo)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x16_Dynamo", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":230.0887928818, "Accuracy":"0.7880099213678822", "number_of_nodes":4, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":16, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x16_Dynamo\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"NVFP4, FP8 (KV cache)", "design_power_watts":null, "PrivateID":null }, "113":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (16x GB200-186GB_aarch64, Dynamo)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x16_Dynamo", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":198.9444574057, "Accuracy":"0.7881503918126641", "number_of_nodes":4, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":16, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x16_Dynamo\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4, FP8 (KV cache)", "design_power_watts":null, "PrivateID":null }, "114":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, Dynamo)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x4_Dynamo", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":3.9940567448, "Accuracy":"0.785571974099286", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x4_Dynamo\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4, FP8 (KV cache)", "design_power_watts":null, "PrivateID":null }, "115":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, Dynamo)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x4_Dynamo", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":58.3958752389, "Accuracy":"0.7870702100264627", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x4_Dynamo\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"NVFP4, FP8 (KV cache)", "design_power_watts":null, "PrivateID":null }, "116":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, Dynamo)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x4_Dynamo", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":49.696288324, "Accuracy":"0.7878435998292614", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x4_Dynamo\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4, FP8 (KV cache)", "design_power_watts":null, "PrivateID":null }, "117":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":50912.9, "Accuracy":"exact_match: 83.691", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x4_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "118":{ "Organization":"Crusoe", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (4x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":50613.5, "Accuracy":"exact_match: 83.642", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Crusoe\/results\/GB200-NVL72_GB200-186GB_aarch64x4_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "119":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge R770AP_128C 24x96GB (6400 MT\/s)", "Platform":"1-node-2S-GNR_128C", "Model":"rgat", "MlperfModel":"rgat", "Scenario":"Offline", "Result":21835.4, "Accuracy":"acc: 72.578", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Dell\/results\/1-node-2S-GNR_128C\/rgat\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "120":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge R770AP_128C 24x96GB (6400 MT\/s)", "Platform":"1-node-2S-GNR_128C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":2275.93, "Accuracy":"ACCURACY: 97.89143156192017", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Dell\/results\/1-node-2S-GNR_128C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 22.04.5 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "121":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge R770_86C 16x64GB (6400 MT\/s)", "Platform":"1-node-2S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":1227.99, "Accuracy":"ROUGE1: 38.6229 ROUGE2: 15.8107 ROUGEL: 24.4082 ROUGELSUM: 35.6517 GEN_LEN: 8188478", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Dell\/results\/1-node-2S-GNR_86C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04 LTS", "notes":"Dell PowerEdge R770. vLLM, FP8 KV Cache", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "122":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge R770_86C 16x64GB (6400 MT\/s)", "Platform":"1-node-2S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":516.012, "Accuracy":"ROUGE1: 38.6453 ROUGE2: 15.8841 ROUGEL: 24.4777 ROUGELSUM: 35.7016 GEN_LEN: 8176464", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Dell\/results\/1-node-2S-GNR_86C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04 LTS", "notes":"Dell PowerEdge R770. vLLM, FP8 KV Cache", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "123":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge R770_86C 16x64GB (6400 MT\/s)", "Platform":"1-node-2S-GNR_86C", "Model":"rgat", "MlperfModel":"rgat", "Scenario":"Offline", "Result":16042.8, "Accuracy":"acc: 72.570", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Dell\/results\/1-node-2S-GNR_86C\/rgat\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04 LTS", "notes":"Dell PowerEdge R770. vLLM, FP8 KV Cache", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "124":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge R770_86C 16x64GB (6400 MT\/s)", "Platform":"1-node-2S-GNR_86C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":1539.49, "Accuracy":"ACCURACY: 97.89904372234645", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Dell\/results\/1-node-2S-GNR_86C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04 LTS", "notes":"Dell PowerEdge R770. vLLM, FP8 KV Cache", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "125":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"Dell Pro Max (1x GB10)", "Platform":"Dell_Pro_Max_GB10x1", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"multistream", "Result":105.162072, "Accuracy":"mAP: 53.113", "number_of_nodes":1, "host_processor_model_name":"Cortex-X925", "host_processors_per_node":20, "host_processor_core_count":"1", "accelerator_model_name":"NVIDIA GB10", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Dell\/results\/Dell_Pro_Max_GB10x1\/yolo-95\/multistream\/performance\/run_1", "framework":"CUDA 13.0", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Dell Pro Max with GB10", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "126":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"Dell Pro Max (1x GB10)", "Platform":"Dell_Pro_Max_GB10x1", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"offline", "Result":78.7257, "Accuracy":"mAP: 53.113", "number_of_nodes":1, "host_processor_model_name":"Cortex-X925", "host_processors_per_node":20, "host_processor_core_count":"1", "accelerator_model_name":"NVIDIA GB10", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Dell\/results\/Dell_Pro_Max_GB10x1\/yolo-95\/offline\/performance\/run_1", "framework":"CUDA 13.0", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Dell Pro Max with GB10", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "127":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"Dell Pro Max (1x GB10)", "Platform":"Dell_Pro_Max_GB10x1", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"singlestream", "Result":13.865536, "Accuracy":"mAP: 53.113", "number_of_nodes":1, "host_processor_model_name":"Cortex-X925", "host_processors_per_node":20, "host_processor_core_count":"1", "accelerator_model_name":"NVIDIA GB10", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Dell\/results\/Dell_Pro_Max_GB10x1\/yolo-95\/singlestream\/performance\/run_1", "framework":"CUDA 13.0", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Dell Pro Max with GB10", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "128":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"Dell Pro Max (1x GB10)", "Platform":"Dell_Pro_Max_GB10x1", "Model":"yolo-99", "MlperfModel":"yolo-99", "Scenario":"multistream", "Result":105.162072, "Accuracy":"mAP: 53.113", "number_of_nodes":1, "host_processor_model_name":"Cortex-X925", "host_processors_per_node":20, "host_processor_core_count":"1", "accelerator_model_name":"NVIDIA GB10", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Dell\/results\/Dell_Pro_Max_GB10x1\/yolo-99\/multistream\/performance\/run_1", "framework":"CUDA 13.0", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Dell Pro Max with GB10", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "129":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"Dell Pro Max (1x GB10)", "Platform":"Dell_Pro_Max_GB10x1", "Model":"yolo-99", "MlperfModel":"yolo-99", "Scenario":"offline", "Result":78.7257, "Accuracy":"mAP: 53.113", "number_of_nodes":1, "host_processor_model_name":"Cortex-X925", "host_processors_per_node":20, "host_processor_core_count":"1", "accelerator_model_name":"NVIDIA GB10", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Dell\/results\/Dell_Pro_Max_GB10x1\/yolo-99\/offline\/performance\/run_1", "framework":"CUDA 13.0", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Dell Pro Max with GB10", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "130":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"Dell Pro Max (1x GB10)", "Platform":"Dell_Pro_Max_GB10x1", "Model":"yolo-99", "MlperfModel":"yolo-99", "Scenario":"singlestream", "Result":13.865536, "Accuracy":"mAP: 53.113", "number_of_nodes":1, "host_processor_model_name":"Cortex-X925", "host_processors_per_node":20, "host_processor_core_count":"1", "accelerator_model_name":"NVIDIA GB10", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Dell\/results\/Dell_Pro_Max_GB10x1\/yolo-99\/singlestream\/performance\/run_1", "framework":"CUDA 13.0", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Dell Pro Max with GB10", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "131":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE7740 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"XE7740_RTXPro6000_PCIe_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":29796.7, "Accuracy":"ROUGE1: 44.7408 ROUGE2: 22.3357 ROUGEL: 29.1354 TOKENS_PER_SAMPLE: 274.4", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE7740_RTXPro6000_PCIe_96GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "132":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE7740 (8x RTXPro6000-PCIe-96GB, TensorRT)", "Platform":"XE7740_RTXPro6000_PCIe_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":28973.3, "Accuracy":"ROUGE1: 44.6929 ROUGE2: 22.2906 ROUGEL: 29.0805 TOKENS_PER_SAMPLE: 267.3", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE7740_RTXPro6000_PCIe_96GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA RTX PRO 6000 Blackwell Server Edition TGP 600W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "133":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE7745 (8x NVIDIA RTX PRO 4500 Blackwell, TensorRT)", "Platform":"XE7745_RTXPRO4500_32GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":4374.06, "Accuracy":"ROUGE1: 44.7919 ROUGE2: 22.3659 ROUGEL: 29.1627 TOKENS_PER_SAMPLE: 273.2", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":1, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE7745_RTXPRO4500_32GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.3", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "134":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE7745 (8x NVIDIA RTX PRO 4500 Blackwell, TensorRT)", "Platform":"XE7745_RTXPRO4500_32GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":3012.33, "Accuracy":"ROUGE1: 44.7861 ROUGE2: 22.3547 ROUGEL: 29.1687 TOKENS_PER_SAMPLE: 271.3", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":1, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE7745_RTXPRO4500_32GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.3", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "135":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell PowerEdge XE9712", "Platform":"XE9712x18", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.6455254875, "Accuracy":"0.7009552217488585", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Dell\/results\/XE9712x18\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "136":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell PowerEdge XE9712", "Platform":"XE9712x18", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":10.5850005407, "Accuracy":"0.6970976320484682", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Dell\/results\/XE9712x18\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "137":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell XE9780 (8x B300-SXM-270GB, TensorRT)", "Platform":"XE9780-B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":109257.0, "Accuracy":"exact_match: 83.610", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"Nvidia B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9780-B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "138":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell XE9780 (8x B300-SXM-270GB, TensorRT)", "Platform":"XE9780-B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":103332.0, "Accuracy":"exact_match: 83.460", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"Nvidia B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9780-B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "139":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell XE9780 (8x B300-SXM-270GB, TensorRT)", "Platform":"XE9780-B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":104006.0, "Accuracy":"ROUGE1: 44.9129 ROUGE2: 22.4979 ROUGEL: 29.3269 TOKENS_PER_SAMPLE: 271.0", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"Nvidia B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9780-B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "140":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell XE9780 (8x B300-SXM-270GB, TensorRT)", "Platform":"XE9780-B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":96180.6, "Accuracy":"ROUGE1: 44.8204 ROUGE2: 22.399 ROUGEL: 29.2127 TOKENS_PER_SAMPLE: 272.0", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6747P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"Nvidia B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9780-B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, Dell Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "141":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":117804.0, "Accuracy":"exact_match: 84.217", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "142":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":110188.0, "Accuracy":"exact_match: 83.843", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "143":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":73238.1, "Accuracy":"ROUGE1: 44.4905 ROUGE2: 22.144 ROUGEL: 28.908 TOKENS_PER_SAMPLE: 284.4", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "144":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":103792.0, "Accuracy":"ROUGE1: 44.5322 ROUGE2: 22.1855 ROUGEL: 28.9228 TOKENS_PER_SAMPLE: 284.4", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "145":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":103932.0, "Accuracy":"ROUGE1: 44.5341 ROUGE2: 22.1716 ROUGEL: 28.9333 TOKENS_PER_SAMPLE: 284.0", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "146":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":130540.0, "Accuracy":"ROUGE1: 38.561 ROUGE2: 16.0262 ROUGEL: 24.4382 ROUGELSUM: 35.6995 GEN_LEN: 8150427", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "147":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":158458.0, "Accuracy":"ROUGE1: 38.5617 ROUGE2: 16.0263 ROUGEL: 24.4381 ROUGELSUM: 35.6994 GEN_LEN: 8151245", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "148":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE9785L_8xMI355X", "Platform":"XE9785L_8xMI355X", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":148563.0, "Accuracy":"ROUGE1: 38.5211 ROUGE2: 16.0095 ROUGEL: 24.4208 ROUGELSUM: 35.662 GEN_LEN: 8168331", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9655", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_8xMI355X\/llama3.1-8b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "149":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell XE9785L (8x B300-SXM-270GB, TensorRT)", "Platform":"XE9785L_x86_B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":113101.0, "Accuracy":"ROUGE1: 44.8017 ROUGE2: 22.3823 ROUGEL: 29.1656 TOKENS_PER_SAMPLE: 272.7", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_x86_B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "150":{ "Organization":"Dell", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Dell XE9785L (8x B300-SXM-270GB, TensorRT)", "Platform":"XE9785L_x86_B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":106898.0, "Accuracy":"ROUGE1: 44.8186 ROUGE2: 22.3916 ROUGEL: 29.1862 TOKENS_PER_SAMPLE: 272.3", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell\/results\/XE9785L_x86_B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "151":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Offline", "Result":4837.63, "Accuracy":"DLRM_NE: 0.8677279311862482 DLRM_ACC: 0.6964196251791978 DLRM_AUC: 0.7862870079033047", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/dlrm-v3\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"int8,bf16", "design_power_watts":null, "PrivateID":null }, "152":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Server", "Result":4503.53, "Accuracy":"DLRM_NE: 0.8677277210685596 DLRM_ACC: 0.6964198708391458 DLRM_AUC: 0.7862873761281074", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/dlrm-v3\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Queries\/s", "weight_data_types":"int8,bf16", "design_power_watts":null, "PrivateID":null }, "153":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":48971.1, "Accuracy":"exact_match: 83.287", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "154":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":40867.9, "Accuracy":"exact_match: 83.631", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "155":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":22860.5, "Accuracy":"ROUGE1: 44.4031 ROUGE2: 22.0641 ROUGEL: 28.8533 TOKENS_PER_SAMPLE: 288.3", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "156":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":42286.2, "Accuracy":"ROUGE1: 44.5012 ROUGE2: 22.1742 ROUGEL: 28.9465 TOKENS_PER_SAMPLE: 284.2", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "157":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":41830.0, "Accuracy":"ROUGE1: 44.4477 ROUGE2: 22.0889 ROUGEL: 28.8674 TOKENS_PER_SAMPLE: 287.4", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "158":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":62723.7, "Accuracy":"ROUGE1: 38.5629 ROUGE2: 16.0233 ROUGEL: 24.4351 ROUGELSUM: 35.6984 GEN_LEN: 8150299", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "159":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":73643.0, "Accuracy":"ROUGE1: 38.5604 ROUGE2: 16.0125 ROUGEL: 24.4415 ROUGELSUM: 35.6907 GEN_LEN: 8149596", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "160":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":72305.1, "Accuracy":"ROUGE1: 38.5633 ROUGE2: 16.0282 ROUGEL: 24.4369 ROUGELSUM: 35.7015 GEN_LEN: 8151565", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/llama3.1-8b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "161":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0345875, "Accuracy":"vbench_score: 69.9361", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "162":{ "Organization":"Dell_AMD", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"XE7745_8xMI350P_2xEPYC_9455", "Platform":"XE7745_8xMI350P_2xEPYC-9455", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":41.837923108, "Accuracy":"vbench_score: 70.3648", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9455", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"AMD Instinct MI350P", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_AMD\/results\/XE7745_8xMI350P_2xEPYC-9455\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS (kernel 6.8.0-136-generic)", "notes":"8x AMD Instinct MI350P (gfx950), 144GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Latency (s)", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "163":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Heterogeneous Four-Cluster (2x8x MI300X + 2x8x MI355X, LLMBoost)", "Platform":"2x8xMI355X_2x8xMI300X", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":285454.0, "Accuracy":"exact_match: 84.250", "number_of_nodes":4, "host_processor_model_name":"AMD EPYC 9534 (on MI300X node) and AMD EPYC 9965 (on MI355X node)", "host_processors_per_node":2, "host_processor_core_count":"64(AMD EPYC 9534) and 192(AMD EPYC 9965)", "accelerator_model_name":"AMD Instinct MI300X 192GB HBM3 (x2x8) and AMD Instinct MI355X 288GB HBM3e (x2x8)", "accelerators_per_node":8, "total_accelerators":32, "Location":".\/closed\/Dell_MangoBoost\/results\/2x8xMI355X_2x8xMI300X\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Heterogeneous Four-Cluster with LLMBoost, vLLM 0.22.1 on MI355X, and vLLM 0.24.0 on MI300X", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "164":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Heterogeneous Four-Cluster (2x8x MI300X + 2x8x MI355X, LLMBoost)", "Platform":"2x8xMI355X_2x8xMI300X", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":253501.0, "Accuracy":"exact_match: 83.574", "number_of_nodes":4, "host_processor_model_name":"AMD EPYC 9534 (on MI300X node) and AMD EPYC 9965 (on MI355X node)", "host_processors_per_node":2, "host_processor_core_count":"64(AMD EPYC 9534) and 192(AMD EPYC 9965)", "accelerator_model_name":"AMD Instinct MI300X 192GB HBM3 (x2x8) and AMD Instinct MI355X 288GB HBM3e (x2x8)", "accelerators_per_node":8, "total_accelerators":32, "Location":".\/closed\/Dell_MangoBoost\/results\/2x8xMI355X_2x8xMI300X\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Heterogeneous Four-Cluster with LLMBoost, vLLM 0.22.1 on MI355X, and vLLM 0.24.0 on MI300X", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "165":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE9785", "Platform":"XE9785", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Interactive", "Result":28265.9, "Accuracy":"exact_match: 83.676", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_MangoBoost\/results\/XE9785\/gpt-oss-120b\/Interactive\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Intra-Node P\/D Disaggregation for Interactive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "166":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE9785", "Platform":"XE9785", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":115294.0, "Accuracy":"exact_match: 83.720", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_MangoBoost\/results\/XE9785\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Intra-Node P\/D Disaggregation for Interactive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "167":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE9785", "Platform":"XE9785", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":109065.0, "Accuracy":"exact_match: 83.806", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_MangoBoost\/results\/XE9785\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Intra-Node P\/D Disaggregation for Interactive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "168":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE9785L", "Platform":"XE9785L", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Interactive", "Result":29585.5, "Accuracy":"exact_match: 84.127", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_MangoBoost\/results\/XE9785L\/gpt-oss-120b\/Interactive\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Intra-Node P\/D Disaggregation for Interactive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "169":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE9785L", "Platform":"XE9785L", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":116953.0, "Accuracy":"exact_match: 83.643", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_MangoBoost\/results\/XE9785L\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Intra-Node P\/D Disaggregation for Interactive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "170":{ "Organization":"Dell_MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PowerEdge XE9785L", "Platform":"XE9785L", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":110153.0, "Accuracy":"exact_match: 83.598", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9965", "host_processors_per_node":2, "host_processor_core_count":"192", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Dell_MangoBoost\/results\/XE9785L\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"ROCm", "operating_system":"Ubuntu 22.04.5 LTS (jammy)", "notes":"Intra-Node P\/D Disaggregation for Interactive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "171":{ "Organization":"Fujitsu", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8, TensorRT)", "Platform":"PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":26626.5, "Accuracy":"ROUGE1: 44.7182 ROUGE2: 22.3154 ROUGEL: 29.104 TOKENS_PER_SAMPLE: 273.6", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8592+", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Fujitsu\/results\/PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.16, CUDA 13.2, cuDNN 9.21", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "172":{ "Organization":"Fujitsu", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8, TensorRT)", "Platform":"PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":27340.9, "Accuracy":"ROUGE1: 44.7475 ROUGE2: 22.3697 ROUGEL: 29.1476 TOKENS_PER_SAMPLE: 274.5", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8592+", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Fujitsu\/results\/PRIMERGY_CDI_RTX_PRO_6000_PCIE_96GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.16, CUDA 13.2, cuDNN 9.21", "operating_system":"Ubuntu 24.04", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "173":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":72445.1, "Accuracy":"exact_match: 81.24430264357338 TOKENS_PER_SAMPLE: 3793.010711030082", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "174":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":70495.7, "Accuracy":"exact_match: 81.26709206927985 TOKENS_PER_SAMPLE: 3788.4774384685506", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "175":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":111625.0, "Accuracy":"exact_match: 83.316", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "176":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":111218.0, "Accuracy":"exact_match: 83.071", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "177":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":115034.0, "Accuracy":"ROUGE1: 44.803 ROUGE2: 22.3802 ROUGEL: 29.1563 TOKENS_PER_SAMPLE: 272.6", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "178":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":114832.0, "Accuracy":"ROUGE1: 44.8381 ROUGE2: 22.394 ROUGEL: 29.1852 TOKENS_PER_SAMPLE: 272.5", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "179":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":12.4854321324, "Accuracy":"0.7879417016152472", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"nvfp4, fp8-kv", "design_power_watts":null, "PrivateID":null }, "180":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":131.2852847184, "Accuracy":"0.7870700970178708", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"nvfp4, fp8-kv", "design_power_watts":null, "PrivateID":null }, "181":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":111.7532977914, "Accuracy":"0.7880503014737441", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"nvfp4, fp8-kv", "design_power_watts":null, "PrivateID":null }, "182":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0629152672, "Accuracy":"0.7028431480110648", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "183":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-AD3-AAX7", "Platform":"G894-AD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":19.0794043884, "Accuracy":"0.7036278864900404", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6979P", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-AD3-AAX7_B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "184":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":72327.1, "Accuracy":"exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3803.4314038286234", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "185":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":70771.7, "Accuracy":"exact_match: 80.76572470373746 TOKENS_PER_SAMPLE: 3851.8625797629898", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "186":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":111541.0, "Accuracy":"exact_match: 82.928", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "187":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":110592.0, "Accuracy":"exact_match: 83.965", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "188":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":114826.0, "Accuracy":"ROUGE1: 44.8002 ROUGE2: 22.3763 ROUGEL: 29.1593 TOKENS_PER_SAMPLE: 272.5", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "189":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":114578.0, "Accuracy":"ROUGE1: 44.8817 ROUGE2: 22.4296 ROUGEL: 29.2316 TOKENS_PER_SAMPLE: 271.9", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "190":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":12.8817797408, "Accuracy":"0.787262910148138", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4 weights with FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "191":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":132.0547880616, "Accuracy":"0.7875530423168103", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"NVFP4 weights with FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "192":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":115.7839399384, "Accuracy":"0.7880234463575065", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4 weights with FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "193":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.062512308, "Accuracy":"0.7048583781540092", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "194":{ "Organization":"GigaComputing", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G894-ZD3-AAX7", "Platform":"G894-ZD3-AAX7_B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":18.0517986718, "Accuracy":"0.6987459561814395", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/GigaComputing\/results\/G894-ZD3-AAX7_B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 22.04.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "195":{ "Organization":"Google", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Interactive", "Result":232160.0, "Accuracy":"exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3809.1959890610756", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Google\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Interactive\/performance\/run_1", "framework":"PyTorch 2.10.0a0+b4e4ee81d3.nv25.12, TensorRT 10.14.1.48, CUDA Toolkit 13.1, cuDNN 9.17.0, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU. DeepSeek-R1 used the pinned aarch64 MLPerf TensorRT-LLM container. Runtime logs show MNNVL\/NVLinkOneSided selection for Offline, Server, and Interactive; colocated Offline\/Server also initialized the NIXL UCX backend, while disaggregated Interactive used a UCX KV-cache transceiver between context and generation services.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "196":{ "Organization":"Google", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":510781.0, "Accuracy":"exact_match: 81.19872379216044 TOKENS_PER_SAMPLE: 3852.355970829535", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Google\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"PyTorch 2.10.0a0+b4e4ee81d3.nv25.12, TensorRT 10.14.1.48, CUDA Toolkit 13.1, cuDNN 9.17.0, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU. DeepSeek-R1 used the pinned aarch64 MLPerf TensorRT-LLM container. Runtime logs show MNNVL\/NVLinkOneSided selection for Offline, Server, and Interactive; colocated Offline\/Server also initialized the NIXL UCX backend, while disaggregated Interactive used a UCX KV-cache transceiver between context and generation services.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "197":{ "Organization":"Google", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":388590.0, "Accuracy":"exact_match: 81.01640838650866 TOKENS_PER_SAMPLE: 3795.0934366453967", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Google\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"PyTorch 2.10.0a0+b4e4ee81d3.nv25.12, TensorRT 10.14.1.48, CUDA Toolkit 13.1, cuDNN 9.17.0, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU. DeepSeek-R1 used the pinned aarch64 MLPerf TensorRT-LLM container. Runtime logs show MNNVL\/NVLinkOneSided selection for Offline, Server, and Interactive; colocated Offline\/Server also initialized the NIXL UCX backend, while disaggregated Interactive used a UCX KV-cache transceiver between context and generation services.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "198":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 by HPE (8x GB200-186GB_aarch64, TensorRT)", "Platform":"HPE_GB200-NVL72_GB200-186GB_aarch64x8", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":101453.0, "Accuracy":"exact_match: 83.727", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_GB200-NVL72_GB200-186GB_aarch64x8\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k", "notes":"NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Two dep8 replicas across two nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "199":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 by HPE (8x GB200-186GB_aarch64, TensorRT)", "Platform":"HPE_GB200-NVL72_GB200-186GB_aarch64x8", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":100714.0, "Accuracy":"exact_match: 83.485", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_GB200-NVL72_GB200-186GB_aarch64x8\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k", "notes":"NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Two dep8 replicas across two nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "200":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant DL145 Gen11 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)", "Platform":"HPE_PROLIANT_DL145_RTX_PRO_4500_PCIE_32GBx1", "Model":"qwen3.6-27b", "MlperfModel":"agentic edge", "Scenario":"SingleStream", "Result":2757.9544040377, "Accuracy":"0.8613065326633166", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 8535P", "host_processors_per_node":1, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL145_RTX_PRO_4500_PCIE_32GBx1\/qwen3.6-27b\/SingleStream\/performance\/run_1", "framework":"llama.cpp", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"int4", "design_power_watts":null, "PrivateID":null }, "201":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL345 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)", "Platform":"HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"multistream", "Result":676.268814, "Accuracy":"mAP: 53.114", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9375F", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1\/yolo-95\/multistream\/performance\/run_1", "framework":"PyTorch v2.13.0", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "202":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL345 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)", "Platform":"HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"offline", "Result":146.207, "Accuracy":"mAP: 53.109", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9375F", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1\/yolo-95\/offline\/performance\/run_1", "framework":"PyTorch v2.13.0", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "203":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL345 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)", "Platform":"HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"singlestream", "Result":76.664039, "Accuracy":"mAP: 53.114", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9375F", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx1\/yolo-95\/singlestream\/performance\/run_1", "framework":"PyTorch v2.13.0", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "204":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT", "Platform":"HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_AGENTIC", "Model":"qwen3.6-27b", "MlperfModel":"agentic edge", "Scenario":"SingleStream", "Result":2616.1590054886, "Accuracy":"0.864321608040201", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9375F", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_AGENTIC\/qwen3.6-27b\/SingleStream\/performance\/run_1", "framework":"llama.cpp", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"int4", "design_power_watts":null, "PrivateID":null }, "205":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT", "Platform":"HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":3685.7, "Accuracy":"ACCURACY: 97.84824462061155", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9375F", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.15.1.29, CUDA 13.2", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "206":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":15256.0, "Accuracy":"exact_match: 82.714", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "207":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":14581.7, "Accuracy":"exact_match: 82.341", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "208":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":29284.8, "Accuracy":"ROUGE1: 44.7216 ROUGE2: 22.3081 ROUGEL: 29.0908 TOKENS_PER_SAMPLE: 274.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "209":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":28643.3, "Accuracy":"ROUGE1: 44.7706 ROUGE2: 22.352 ROUGEL: 29.1377 TOKENS_PER_SAMPLE: 272.0", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "210":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":39986.3, "Accuracy":"ROUGE1: 38.7645 ROUGE2: 16.0515 ROUGEL: 24.5586 ROUGELSUM: 35.6824 GEN_LEN: 8173226", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "211":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":50965.3, "Accuracy":"ROUGE1: 38.7974 ROUGE2: 16.0868 ROUGEL: 24.5879 ROUGELSUM: 35.7199 GEN_LEN: 8172782", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "212":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":49523.3, "Accuracy":"ROUGE1: 38.7821 ROUGE2: 16.0772 ROUGEL: 24.5857 ROUGELSUM: 35.7074 GEN_LEN: 8172428", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "213":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute DL380a Gen12 (8x RTX Pro 6000 Blackwell Server Edition 96GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":19278.3, "Accuracy":"ACCURACY: 97.88345689351618", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380A_RTX_PRO_6000_PCIE_96GBx8\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.16.1.11, CUDA 13.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "214":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB)", "Platform":"HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"multistream", "Result":116.101325, "Accuracy":"mAP: 53.112", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6762P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT\/yolo-95\/multistream\/performance\/run_1", "framework":"PyTorch v2.13.0", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "215":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB)", "Platform":"HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"offline", "Result":72.1855, "Accuracy":"mAP: 53.112", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6762P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT\/yolo-95\/offline\/performance\/run_1", "framework":"PyTorch v2.13.0", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "216":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB)", "Platform":"HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT", "Model":"yolo-95", "MlperfModel":"yolo-95", "Scenario":"singlestream", "Result":14.136709, "Accuracy":"mAP: 53.112", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6762P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT\/yolo-95\/singlestream\/performance\/run_1", "framework":"PyTorch v2.13.0", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "217":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL380 Gen12 (5x NVIDIA RTX PRO 4500 Blackwell Server Edition 32GB, TensorRT)", "Platform":"HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx5_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":4719.46, "Accuracy":"ACCURACY: 97.85585808502336", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6762P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell Server Edition", "accelerators_per_node":5, "total_accelerators":5, "Location":".\/closed\/HPE\/results\/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx5_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.11.0.33, CUDA 13.2", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "218":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":117355.0, "Accuracy":"exact_match: 83.687", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "219":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":108836.0, "Accuracy":"exact_match: 83.864", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "220":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":72977.2, "Accuracy":"ROUGE1: 44.5152 ROUGE2: 22.1564 ROUGEL: 28.9213 TOKENS_PER_SAMPLE: 284.1", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "221":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":102991.0, "Accuracy":"ROUGE1: 44.5406 ROUGE2: 22.1922 ROUGEL: 28.9322 TOKENS_PER_SAMPLE: 284.2", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "222":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":101979.0, "Accuracy":"ROUGE1: 44.5325 ROUGE2: 22.1714 ROUGEL: 28.9308 TOKENS_PER_SAMPLE: 284.1", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "223":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":130613.0, "Accuracy":"ROUGE1: 38.567 ROUGE2: 16.0282 ROUGEL: 24.4449 ROUGELSUM: 35.7031 GEN_LEN: 8150301", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "224":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":157694.0, "Accuracy":"ROUGE1: 38.5626 ROUGE2: 16.0276 ROUGEL: 24.4431 ROUGELSUM: 35.699 GEN_LEN: 8151086", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "225":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":148118.0, "Accuracy":"ROUGE1: 38.5316 ROUGE2: 16.0159 ROUGEL: 24.4259 ROUGELSUM: 35.6716 GEN_LEN: 8162750", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/llama3.1-8b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "226":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0707035, "Accuracy":"vbench_score: 70.1048", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "227":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE ProLiant Compute XD685 (8x AMD MI355X-288GB, vLLM)", "Platform":"HPE_XD685_MI355X_288GBx8_vLLM", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":16.397060151, "Accuracy":"vbench_score: 70.3025", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD685_MI355X_288GBx8_vLLM\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.5 LTS (kernel 5.15.0-186-generic)", "notes":"HPE ProLiant Compute XD685; 8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Latency (s)", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "228":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"HPE_XD690_B300_SXM_270GBx16_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":136854.0, "Accuracy":"exact_match: 81.24430264357338 TOKENS_PER_SAMPLE: 3826.166362807657", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/HPE\/results\/HPE_XD690_B300_SXM_270GBx16_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.2", "operating_system":"RHEL 9.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "229":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"HPE_XD690_B300_SXM_270GBx16_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":80536.9, "Accuracy":"exact_match: 80.92525068368278 TOKENS_PER_SAMPLE: 3807.0186873290795", "number_of_nodes":2, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/HPE\/results\/HPE_XD690_B300_SXM_270GBx16_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.2", "operating_system":"RHEL 9.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "230":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"HPE_XD690_B300_SXM_270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":114569.0, "Accuracy":"exact_match: 83.235", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD690_B300_SXM_270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.2", "operating_system":"RHEL 9.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "231":{ "Organization":"HPE", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"HPE_XD690_B300_SXM_270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":113685.0, "Accuracy":"exact_match: 83.448", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/HPE\/results\/HPE_XD690_B300_SXM_270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.2", "operating_system":"RHEL 9.4", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "232":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_128C", "Platform":"1-node-2S-GNR_128C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":1916.74, "Accuracy":"ROUGE1: 38.6418 ROUGE2: 15.8693 ROUGEL: 24.4809 ROUGELSUM: 35.6703 GEN_LEN: 8194131", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Intel\/results\/1-node-2S-GNR_128C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"CentOS Stream 9", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "233":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_128C", "Platform":"1-node-2S-GNR_128C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":1139.51, "Accuracy":"ROUGE1: 38.6681 ROUGE2: 15.9242 ROUGEL: 24.5144 ROUGELSUM: 35.7046 GEN_LEN: 8206137", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Intel\/results\/1-node-2S-GNR_128C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"CentOS Stream 9", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "234":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_128C", "Platform":"1-node-2S-GNR_128C", "Model":"rgat", "MlperfModel":"rgat", "Scenario":"Offline", "Result":24573.7, "Accuracy":"acc: 72.541", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Intel\/results\/1-node-2S-GNR_128C\/rgat\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"CentOS Stream 9", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "235":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_128C", "Platform":"1-node-2S-GNR_128C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":2319.02, "Accuracy":"ACCURACY: 97.89143156192017", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Intel\/results\/1-node-2S-GNR_128C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"CentOS Stream 9", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "236":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-Xeon_6787P", "Platform":"1-node-2S-Xeon_6787P", "Model":"e2e-rag-db", "MlperfModel":"end to end vector-database", "Scenario":"Offline", "Result":22.6141, "Accuracy":"E2E_ACCURACY: 98.1952", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-2S-Xeon_6787P\/e2e-rag-db\/Offline\/performance\/run_1", "framework":"vLLM 0.22.1rc1.dev189+ga55fccfc7.d20260604, PyTorch 2.11.0+cpu, FAISS 1.14.3", "operating_system":"Ubuntu 24.04.4 LTS (kernel 7.0.0-28-generic)", "notes":"e2e-rag-qna: gpt-oss-120b on 4x Intel Arc Pro B70 (TP=4); gpt-oss-20b grader, e5-base-v2 embedding and colbertv2.0 reranking on CPU. e2e-rag-db: CPU-only vector-database build, no accelerator used.. e2e-rag-qna: async multi-shot RAG pipeline with pinned CPU embedding\/FAISS and reranking services. e2e-rag-db: vector DB built from the frozen docs.tar.gz Wikipedia corpus (2515 HTML pages).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "237":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-Xeon_6787P", "Platform":"1-node-2S-Xeon_6787P", "Model":"e2e-rag-qna", "MlperfModel":"end to end question-answering", "Scenario":"Offline", "Result":0.464076, "Accuracy":"E2E_ACCURACY: 35.9223", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-2S-Xeon_6787P\/e2e-rag-qna\/Offline\/performance\/run_1", "framework":"vLLM 0.22.1rc1.dev189+ga55fccfc7.d20260604, PyTorch 2.11.0+cpu, FAISS 1.14.3", "operating_system":"Ubuntu 24.04.4 LTS (kernel 7.0.0-28-generic)", "notes":"e2e-rag-qna: gpt-oss-120b on 4x Intel Arc Pro B70 (TP=4); gpt-oss-20b grader, e5-base-v2 embedding and colbertv2.0 reranking on CPU. e2e-rag-db: CPU-only vector-database build, no accelerator used.. e2e-rag-qna: async multi-shot RAG pipeline with pinned CPU embedding\/FAISS and reranking services. e2e-rag-db: vector DB built from the frozen docs.tar.gz Wikipedia corpus (2515 HTML pages).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tasks\/s", "weight_data_types":"mxfp4 (LLMs), fp32 (embedding\/reranker)", "design_power_watts":null, "PrivateID":null }, "238":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":1956.4, "Accuracy":"exact_match: 83.674", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 698X", "host_processors_per_node":1, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-4x-BMG-B70\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"MXFP4", "design_power_watts":null, "PrivateID":null }, "239":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":1296.87, "Accuracy":"exact_match: 83.489", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 698X", "host_processors_per_node":1, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-4x-BMG-B70\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"MXFP4", "design_power_watts":null, "PrivateID":null }, "240":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":2464.98, "Accuracy":"ROUGE1: 44.5947 ROUGE2: 22.2074 ROUGEL: 28.8264 TOKENS_PER_SAMPLE: 290.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 698X", "host_processors_per_node":1, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-4x-BMG-B70\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "241":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":1745.48, "Accuracy":"ROUGE1: 44.5937 ROUGE2: 22.2052 ROUGEL: 28.8276 TOKENS_PER_SAMPLE: 290.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 698X", "host_processors_per_node":1, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-4x-BMG-B70\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "242":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":4613.28, "Accuracy":"ROUGE1: 38.843 ROUGE2: 16.0878 ROUGEL: 24.6429 ROUGELSUM: 35.9449 GEN_LEN: 8127480", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 698X", "host_processors_per_node":1, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-4x-BMG-B70\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "243":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":4173.25, "Accuracy":"ROUGE1: 38.8131 ROUGE2: 16.0827 ROUGEL: 24.6388 ROUGELSUM: 35.9153 GEN_LEN: 8126165", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 698X", "host_processors_per_node":1, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-4x-BMG-B70\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "244":{ "Organization":"Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":5539.77, "Accuracy":"ACCURACY: 97.45763518206644", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 698X", "host_processors_per_node":1, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Intel\/results\/1-node-4x-BMG-B70\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "245":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P5800G7-B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":70269.6, "Accuracy":"exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3748.471741112124", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P5800G7-B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "246":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P5800G7-B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":57432.0, "Accuracy":"exact_match: 81.10756608933455 TOKENS_PER_SAMPLE: 3769.7967183226983", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P5800G7-B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "247":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P5800G7-B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":106280.0, "Accuracy":"exact_match: 83.856", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P5800G7-B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "248":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P5800G7-B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":100299.0, "Accuracy":"exact_match: 83.423", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P5800G7-B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "249":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P5800G7-B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":109933.0, "Accuracy":"ROUGE1: 44.7871 ROUGE2: 22.3677 ROUGEL: 29.1429 TOKENS_PER_SAMPLE: 272.9", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P5800G7-B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "250":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P5800G7(LC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P5800G7-B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":106617.0, "Accuracy":"ROUGE1: 44.8264 ROUGE2: 22.3815 ROUGEL: 29.1549 TOKENS_PER_SAMPLE: 272.1", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P5800G7-B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "251":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P9000G7-B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":69062.2, "Accuracy":"exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3743.316089334549", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P9000G7-B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "252":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P9000G7-B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":57517.4, "Accuracy":"exact_match: 80.62898814949864 TOKENS_PER_SAMPLE: 3774.6118960802187", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P9000G7-B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "253":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P9000G7-B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":105617.0, "Accuracy":"exact_match: 83.550", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P9000G7-B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "254":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P9000G7-B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":100300.0, "Accuracy":"exact_match: 83.799", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P9000G7-B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "255":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P9000G7-B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":109755.0, "Accuracy":"ROUGE1: 44.7774 ROUGE2: 22.365 ROUGEL: 29.1457 TOKENS_PER_SAMPLE: 272.9", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P9000G7-B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "256":{ "Organization":"Inventec", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Inventec P9000G7(AC) (8x B300-SXM-270GB, TensorRT)", "Platform":"P9000G7-B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":106645.0, "Accuracy":"ROUGE1: 44.8297 ROUGE2: 22.3857 ROUGEL: 29.1786 TOKENS_PER_SAMPLE: 272.2", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Inventec\/results\/P9000G7-B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "257":{ "Organization":"Lambda", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Lambda Cloud 8x B200-SXM-180GB", "Platform":"B200-SXM-180GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":101.5607239508, "Accuracy":"0.7879966032452779", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Lambda\/results\/B200-SXM-180GBx8_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM (GPT-OSS-120B); vLLM + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x NVIDIA B200-SXM-180GB (TGP 1000W).. GPT-OSS-120B via TensorRT-LLM LoadGen harness; Qwen3-VL-235B via NVIDIA inference-endpoint (vLLM+Dynamo), endpoint result format.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"nvfp4", "design_power_watts":null, "PrivateID":null }, "258":{ "Organization":"Lambda", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Lambda Cloud 8x B200-SXM-180GB", "Platform":"B200-SXM-180GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":69.4153619622, "Accuracy":"0.7878950642363143", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Lambda\/results\/B200-SXM-180GBx8_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT-LLM (GPT-OSS-120B); vLLM + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x NVIDIA B200-SXM-180GB (TGP 1000W).. GPT-OSS-120B via TensorRT-LLM LoadGen harness; Qwen3-VL-235B via NVIDIA inference-endpoint (vLLM+Dynamo), endpoint result format.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"nvfp4", "design_power_watts":null, "PrivateID":null }, "259":{ "Organization":"Lambda", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Lambda 4x GB300-288GB (GB300 NVL4, aarch64)", "Platform":"GB300-NVL4_GB300-288GB_aarch64x4", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":65511.9, "Accuracy":"exact_match: 82.738", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Lambda\/results\/GB300-NVL4_GB300-288GB_aarch64x4\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0", "operating_system":"Ubuntu 24.04.4 LTS (aarch64)", "notes":"Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA\/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis\/Enroot containers.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "260":{ "Organization":"Lambda", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Lambda 4x GB300-288GB (GB300 NVL4, aarch64)", "Platform":"GB300-NVL4_GB300-288GB_aarch64x4", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":58195.8, "Accuracy":"exact_match: 83.079", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Lambda\/results\/GB300-NVL4_GB300-288GB_aarch64x4\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0", "operating_system":"Ubuntu 24.04.4 LTS (aarch64)", "notes":"Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA\/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis\/Enroot containers.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"mxfp4", "design_power_watts":null, "PrivateID":null }, "261":{ "Organization":"Lambda", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Lambda 4x GB300-288GB (GB300 NVL4, aarch64)", "Platform":"GB300-NVL4_GB300-288GB_aarch64x4", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":71.1217334487, "Accuracy":"0.7874268401845349", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Lambda\/results\/GB300-NVL4_GB300-288GB_aarch64x4\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0", "operating_system":"Ubuntu 24.04.4 LTS (aarch64)", "notes":"Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA\/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis\/Enroot containers.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"nvfp4", "design_power_watts":null, "PrivateID":null }, "262":{ "Organization":"Lambda", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Lambda 4x GB300-288GB (GB300 NVL4, aarch64)", "Platform":"GB300-NVL4_GB300-288GB_aarch64x4", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":64.6244827794, "Accuracy":"0.787136982780776", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Lambda\/results\/GB300-NVL4_GB300-288GB_aarch64x4\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc14 (GPT-OSS-120B); vLLM (CentML) 0.20.2rc1.dev2091+g2e1040b7e + NVIDIA Dynamo (Qwen3-VL-235B); CUDA 13.0", "operating_system":"Ubuntu 24.04.4 LTS (aarch64)", "notes":"Single GB300 NVL4 node (Supermicro PIO-FRU-121GL-NB3-LCC-R1): 2x NVIDIA Grace CPU (72 cores each) + 4x NVIDIA GB300 288GB HBM3e, 1400W TGP per GPU, direct all-to-all 5th-gen NVLink (no NVLink Switch). GPU HBM is exposed as coherent NUMA memory alongside the 960GB of Grace LPDDR5X.. GPT-OSS-120B served with TensorRT-LLM (trtllm-serve, in-flight batching) as 4 data-parallel replicas (one GPU per replica) behind the MLPerf LoadGen harness. Qwen3-VL-235B-A22B served with vLLM + NVIDIA Dynamo as 4 data-parallel replicas (TP=1, one GPU per replica) and benchmarked with the NVIDIA\/MLCommons inference-endpoints client; endpoint result format. Both workflows orchestrated by nv-sflow on Slurm with Pyxis\/Enroot containers.", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"nvfp4", "design_power_watts":null, "PrivateID":null }, "263":{ "Organization":"MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"MangoBoost 2x8 MI355X (16x MI355X, LLMBoost P\/D Disaggregated Interactive Engine)", "Platform":"16xMI355X_2xEPYC_9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Interactive", "Result":59297.4, "Accuracy":"exact_match: 83.867", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/MangoBoost\/results\/16xMI355X_2xEPYC_9575F\/gpt-oss-120b\/Interactive\/performance\/run_1", "framework":"ROCm 7.2.0", "operating_system":"Ubuntu 22.04.5 LTS (jammy), kernel 6.8.0-84-generic", "notes":"2-node MI355X connect with 8x 40GB\/s RDMA NICs. P\/D Disaggregation for Interavtive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "264":{ "Organization":"MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"MangoBoost 2x8 MI355X (16x MI355X, LLMBoost P\/D Disaggregated Interactive Engine)", "Platform":"16xMI355X_2xEPYC_9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":228488.0, "Accuracy":"exact_match: 83.502", "number_of_nodes":2, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":16, "Location":".\/closed\/MangoBoost\/results\/16xMI355X_2xEPYC_9575F\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"ROCm 7.2.0", "operating_system":"Ubuntu 22.04.5 LTS (jammy), kernel 6.8.0-84-generic", "notes":"2-node MI355X connect with 8x 40GB\/s RDMA NICs. P\/D Disaggregation for Interavtive Scenario, and vLLM 0.22.1", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "265":{ "Organization":"MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI300X_2xEPYC_9534", "Platform":"8xMI300X_2xEPYC_9534", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":30198.4, "Accuracy":"exact_match: 83.713", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9534", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI300X 192GB HBM3", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MangoBoost\/results\/8xMI300X_2xEPYC_9534\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.24.0 (stock vllm\/vllm-openai-rocm:v0.24.0), ROCm 7.2.1", "operating_system":"Ubuntu 22.04.5 LTS", "notes":"8xMI300X_2xEPYC_9534. Self-quantized w-fp8-a-fp8 gpt-oss-120b (AMD Quark 0.12) on stock vLLM 0.24.0 (vllm\/vllm-openai-rocm:v0.24.0).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "266":{ "Organization":"MangoBoost", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI300X_2xEPYC_9534", "Platform":"8xMI300X_2xEPYC_9534", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":24863.0, "Accuracy":"exact_match: 82.842", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9534", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI300X 192GB HBM3", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MangoBoost\/results\/8xMI300X_2xEPYC_9534\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.24.0 (stock vllm\/vllm-openai-rocm:v0.24.0), ROCm 7.2.1", "operating_system":"Ubuntu 22.04.5 LTS", "notes":"8xMI300X_2xEPYC_9534. Self-quantized w-fp8-a-fp8 gpt-oss-120b (AMD Quark 0.12) on stock vLLM 0.24.0 (vllm\/vllm-openai-rocm:v0.24.0).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "267":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":97019.7, "Accuracy":"exact_match: 83.639", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "268":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":87549.5, "Accuracy":"exact_match: 83.316", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "269":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":56673.0, "Accuracy":"ROUGE1: 44.5133 ROUGE2: 22.148 ROUGEL: 28.9008 TOKENS_PER_SAMPLE: 284.9", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "270":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":84016.4, "Accuracy":"ROUGE1: 44.4551 ROUGE2: 22.0787 ROUGEL: 28.8207 TOKENS_PER_SAMPLE: 283.0", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "271":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":85004.8, "Accuracy":"ROUGE1: 44.5423 ROUGE2: 22.1706 ROUGEL: 28.9236 TOKENS_PER_SAMPLE: 284.5", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "272":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":104368.0, "Accuracy":"ROUGE1: 38.5707 ROUGE2: 16.0354 ROUGEL: 24.4433 ROUGELSUM: 35.708 GEN_LEN: 8150585", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "273":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":129943.0, "Accuracy":"ROUGE1: 38.5694 ROUGE2: 16.0367 ROUGEL: 24.4456 ROUGELSUM: 35.7078 GEN_LEN: 8150329", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "274":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G8825Z5", "Platform":"8xMI350X_2xEPYC-9755", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":121706.0, "Accuracy":"ROUGE1: 38.5208 ROUGE2: 16.0104 ROUGEL: 24.424 ROUGELSUM: 35.666 GEN_LEN: 8168845", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI350X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI350X_2xEPYC-9755\/llama3.1-8b\/Server\/performance\/run_1", "framework":"Pytorch 2.10, ROCm 7.2.2", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "275":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":118042.0, "Accuracy":"exact_match: 83.861", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "276":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":108861.0, "Accuracy":"exact_match: 84.039", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "277":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":74385.6, "Accuracy":"ROUGE1: 44.5012 ROUGE2: 22.1509 ROUGEL: 28.9111 TOKENS_PER_SAMPLE: 284.1", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "278":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":104904.0, "Accuracy":"ROUGE1: 44.5341 ROUGE2: 22.1837 ROUGEL: 28.9253 TOKENS_PER_SAMPLE: 284.3", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "279":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":104541.0, "Accuracy":"ROUGE1: 44.5342 ROUGE2: 22.1734 ROUGEL: 28.9337 TOKENS_PER_SAMPLE: 284.0", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "280":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":136999.0, "Accuracy":"ROUGE1: 38.5359 ROUGE2: 16.0141 ROUGEL: 24.4288 ROUGELSUM: 35.6751 GEN_LEN: 8162900", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "281":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":159278.0, "Accuracy":"ROUGE1: 38.5554 ROUGE2: 16.0227 ROUGEL: 24.4331 ROUGELSUM: 35.6963 GEN_LEN: 8150276", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "282":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"G4826", "Platform":"8xMI355X_2xEPYC-9755", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":151116.0, "Accuracy":"ROUGE1: 38.5121 ROUGE2: 15.9993 ROUGEL: 24.4128 ROUGELSUM: 35.6518 GEN_LEN: 8170944", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9755", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/8xMI355X_2xEPYC-9755\/llama3.1-8b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0+git8514f05, ROCm 7.2.53211", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "283":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8", "Platform":"MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":30034.2, "Accuracy":"ROUGE1: 44.7186 ROUGE2: 22.3366 ROUGEL: 29.1057 TOKENS_PER_SAMPLE: 275.5", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.2", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "284":{ "Organization":"MiTAC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8", "Platform":"MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":29203.3, "Accuracy":"ROUGE1: 44.8047 ROUGE2: 22.3347 ROUGEL: 29.1315 TOKENS_PER_SAMPLE: 267.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"172", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/MiTAC\/results\/MiTAC_G4520G6_RTX_PRO_6000_PCIE_96GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.2", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "285":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":70132.3, "Accuracy":"exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3793.9359617137648", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "286":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":59867.8, "Accuracy":"exact_match: 81.17593436645396 TOKENS_PER_SAMPLE: 3818.7203737465816", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "287":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":106637.0, "Accuracy":"exact_match: 83.430", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "288":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":100630.0, "Accuracy":"exact_match: 83.702", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "289":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":109277.0, "Accuracy":"ROUGE1: 44.7951 ROUGE2: 22.3759 ROUGEL: 29.1534 TOKENS_PER_SAMPLE: 272.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "290":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":106949.0, "Accuracy":"ROUGE1: 44.8452 ROUGE2: 22.4177 ROUGEL: 29.2149 TOKENS_PER_SAMPLE: 272.7", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "291":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":3.9944289632, "Accuracy":"0.7863529411764706", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "292":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":129.3583917214, "Accuracy":"0.788067250804375", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "293":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":104.5781916389, "Accuracy":"0.787266660240787", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "294":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0621886628, "Accuracy":"0.7024464645142161", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "295":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":17.9771833069, "Accuracy":"0.7019984343473832", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "296":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Interactive", "Result":240274.0, "Accuracy":"exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3834.577939835916", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "297":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":523790.0, "Accuracy":"exact_match: 81.0619872379216 TOKENS_PER_SAMPLE: 3795.436417502279", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "298":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":395940.0, "Accuracy":"exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3823.4881494986325", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "299":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Interactive", "Result":625205.0, "Accuracy":"exact_match: 83.374", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/gpt-oss-120b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "300":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":883761.0, "Accuracy":"exact_match: 84.038", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "301":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":899005.0, "Accuracy":"exact_match: 83.914", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "302":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.4960942572, "Accuracy":"0.7018512713495823", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "303":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 (72x GB200-186GB_aarch64, TensorRT)", "Platform":"GB200-NVL72_GB200-186GB_aarch64x72_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":5.7315499433, "Accuracy":"0.7027881259253183", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB200-NVL72_GB200-186GB_aarch64x72_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB200 NVL72, 1200W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "304":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x288_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":2705130.0, "Accuracy":"exact_match: 81.19872379216044 TOKENS_PER_SAMPLE: 3809.0271194165907", "number_of_nodes":72, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":288, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x288_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "305":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x288_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":2028030.0, "Accuracy":"exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3861.4316317228804", "number_of_nodes":72, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":288, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x288_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "306":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Interactive", "Result":253506.0, "Accuracy":"exact_match: 81.40382862351869 TOKENS_PER_SAMPLE: 3825.619416590702", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "307":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":679740.0, "Accuracy":"exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3800.5963992707384", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "308":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":596944.0, "Accuracy":"exact_match: 81.42661804922516 TOKENS_PER_SAMPLE: 3855.550136736554", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "309":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Interactive", "Result":669305.0, "Accuracy":"exact_match: 83.495", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "310":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":1124500.0, "Accuracy":"exact_match: 82.861", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "311":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":1120710.0, "Accuracy":"exact_match: 83.069", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "312":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":349.2921988474, "Accuracy":"0.7853930563050908", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "313":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":1304.9852625797, "Accuracy":"0.787383322355058", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "314":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":1210.4882348297, "Accuracy":"0.7869294905778593", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "315":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.6546111599, "Accuracy":"0.6979912810173431", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "316":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":5.8076511629, "Accuracy":"0.6998451039205666", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "317":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":75918.2, "Accuracy":"exact_match: 81.13035551504102 TOKENS_PER_SAMPLE: 3843.4847310847767", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "318":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":67578.3, "Accuracy":"exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3829.014357338195", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "319":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":131619.0, "Accuracy":"exact_match: 82.963", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "320":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":128173.0, "Accuracy":"exact_match: 83.020", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "321":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":131464.0, "Accuracy":"ROUGE1: 44.8017 ROUGE2: 22.3794 ROUGEL: 29.1616 TOKENS_PER_SAMPLE: 272.6", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "322":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":127911.0, "Accuracy":"ROUGE1: 44.8324 ROUGE2: 22.3953 ROUGEL: 29.1865 TOKENS_PER_SAMPLE: 272.1", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/NVIDIA\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.1", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "323":{ "Organization":"NVIDIA", "Availability":"available", "Division":"closed", "SystemType":"edge", "SystemName":"NVIDIA Jetson AGX Thor Developer Kit 128G (TensorRT)", "Platform":"Jetson-Thor", "Model":"qwen3.6-27b", "MlperfModel":"agentic edge", "Scenario":"SingleStream", "Result":1466.007675717, "Accuracy":"0.8793969849246231", "number_of_nodes":1, "host_processor_model_name":"14-core ARM Poseidon-AE CPU", "host_processors_per_node":1, "host_processor_core_count":"14", "accelerator_model_name":"NVIDIA Jetson AGX Thor 128G", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/NVIDIA\/results\/Jetson-Thor\/qwen3.6-27b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.16, CUDA 13.2", "operating_system":"Jetson L4T", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "324":{ "Organization":"NVIDIA", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)", "Platform":"VR200-NVL72_GR200-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Interactive", "Result":652750.1447708113, "Accuracy":"80.62898814949864", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/VR200-NVL72_GR200-288GB_aarch64x72_TRT\/deepseek-r1\/Interactive\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "325":{ "Organization":"NVIDIA", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)", "Platform":"VR200-NVL72_GR200-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":1183326.8540322022, "Accuracy":"81.35824977210574", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/VR200-NVL72_GR200-288GB_aarch64x72_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "326":{ "Organization":"NVIDIA", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)", "Platform":"VR200-NVL72_GR200-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":1175890.2208168239, "Accuracy":"81.42661804922516", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/VR200-NVL72_GR200-288GB_aarch64x72_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "327":{ "Organization":"NVIDIA", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)", "Platform":"VR200-NVL72_GR200-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":1306.6078446835, "Accuracy":"0.7845128091628396", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/VR200-NVL72_GR200-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "328":{ "Organization":"NVIDIA", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)", "Platform":"VR200-NVL72_GR200-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":2392.6979194588, "Accuracy":"0.7871815525981819", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/VR200-NVL72_GR200-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "329":{ "Organization":"NVIDIA", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA VR200 NVL72 (72x VR200-288GB_aarch64)", "Platform":"VR200-NVL72_GR200-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":2323.2698417825, "Accuracy":"0.7874153796727632", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/NVIDIA\/results\/VR200-NVL72_GR200-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "330":{ "Organization":"Naeem Khoshnevis", "Availability":"rdi", "Division":"closed", "SystemType":"datacenter", "SystemName":"H200-1xGPU", "Platform":"H200", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":7796.5851325945, "Accuracy":"rouge1: 38.6405 rouge2: 15.9282 rougeL: 24.5018 rougeLsum: 35.7399 gen_len: 8222392 gen_num: 13368", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9374F 32-Core Processor", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA H200-SXM-141GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Naeem Khoshnevis\/results\/H200\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM 1.0.0 (FP8 W8A8 engine built with trtllm-build, served by trtllm-serve); MLCommons endpoints (LoadGen++) client; CUDA 12.9", "operating_system":"Rocky Linux 8.10", "notes":"H200 node; 4x NVIDIA H200 141GB per node, 1 GPU used for llama3.1-8b. Subset-of-node use is disclosed: the job was cgroup-limited to 16 host CPU cores and 220-240 GB of host RAM depending on scenario (Offline 240 GB, Server 220 GB) out of the node's 2x32-core CPUs and 1.5 TB. GPU ECC verified enabled via nvidia-smi on the GPU used.. llama3.1-8b served by TensorRT-LLM 1.0.0 as an FP8 (W8A8) engine with FP8 KV cache. Weights quantized by NVIDIA ModelOpt static per-tensor PTQ calibrated on the MLPerf-official CNN\/DailyMail calibration id list (calibration\/CNNDailyMail\/calibration-list.txt, 998 unique ids; ModelOpt consumed a 512-row prefix spanning 510 unique ids). Calibration inputs were reconstructed from the ids as raw article text, not the reference instruction-templated calibration file; see documentation\/calibration.md. TP1. KV-cache block reuse explicitly DISABLED via --extra_llm_api_options (enable_block_reuse, enable_partial_reuse and copy_on_partial_reuse all false in both scenarios).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8 (static per-tensor PTQ, NVIDIA ModelOpt)", "design_power_watts":null, "PrivateID":null }, "331":{ "Organization":"Naeem Khoshnevis", "Availability":"rdi", "Division":"closed", "SystemType":"datacenter", "SystemName":"H200-1xGPU", "Platform":"H200", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":7376.5976662324, "Accuracy":"rouge1: 38.6354 rouge2: 15.9256 rougeL: 24.4991 rougeLsum: 35.7316 gen_len: 8222691 gen_num: 13368", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9374F 32-Core Processor", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA H200-SXM-141GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/Naeem Khoshnevis\/results\/H200\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT-LLM 1.0.0 (FP8 W8A8 engine built with trtllm-build, served by trtllm-serve); MLCommons endpoints (LoadGen++) client; CUDA 12.9", "operating_system":"Rocky Linux 8.10", "notes":"H200 node; 4x NVIDIA H200 141GB per node, 1 GPU used for llama3.1-8b. Subset-of-node use is disclosed: the job was cgroup-limited to 16 host CPU cores and 220-240 GB of host RAM depending on scenario (Offline 240 GB, Server 220 GB) out of the node's 2x32-core CPUs and 1.5 TB. GPU ECC verified enabled via nvidia-smi on the GPU used.. llama3.1-8b served by TensorRT-LLM 1.0.0 as an FP8 (W8A8) engine with FP8 KV cache. Weights quantized by NVIDIA ModelOpt static per-tensor PTQ calibrated on the MLPerf-official CNN\/DailyMail calibration id list (calibration\/CNNDailyMail\/calibration-list.txt, 998 unique ids; ModelOpt consumed a 512-row prefix spanning 510 unique ids). Calibration inputs were reconstructed from the ids as raw article text, not the reference instruction-templated calibration file; see documentation\/calibration.md. TP1. KV-cache block reuse explicitly DISABLED via --extra_llm_api_options (enable_block_reuse, enable_partial_reuse and copy_on_partial_reuse all false in both scenarios).", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8 (static per-tensor PTQ, NVIDIA ModelOpt)", "design_power_watts":null, "PrivateID":null }, "332":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":56929.9, "Accuracy":"exact_match: 81.08477666362808 TOKENS_PER_SAMPLE: 3808.5396536007293", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8580", "host_processors_per_node":2, "host_processor_core_count":"60", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B200-SXM-180GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU\/Linux)", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "333":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":55869.0, "Accuracy":"exact_match: 80.62898814949864 TOKENS_PER_SAMPLE: 3840.4710574293526", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8580", "host_processors_per_node":2, "host_processor_core_count":"60", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B200-SXM-180GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU\/Linux)", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "334":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":88491.0, "Accuracy":"exact_match: 83.040", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8580", "host_processors_per_node":2, "host_processor_core_count":"60", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B200-SXM-180GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU\/Linux)", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "335":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B200 n1 (8x B200-SXM-180GB, TensorRT)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":89856.3, "Accuracy":"exact_match: 82.998", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8580", "host_processors_per_node":2, "host_processor_core_count":"60", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B200-SXM-180GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04.3 LTS (Linux kernel: 6.11.0-1016-nvidia #16-Ubuntu SMP PREEMPT_DYNAMIC Sun Sep 21 17:06:33 UTC 2025 x86_64 x86_64 x86_64 GNU\/Linux)", "notes":"B200 TGP 1000W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "336":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":69655.1, "Accuracy":"exact_match: 80.81130355515042 TOKENS_PER_SAMPLE: 3831.6855059252507", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "337":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":63909.3, "Accuracy":"exact_match: 81.67730173199635 TOKENS_PER_SAMPLE: 3826.9986326344574", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "338":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":108529.0, "Accuracy":"exact_match: 83.782", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "339":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":108124.0, "Accuracy":"exact_match: 83.224", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "340":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":131.4771630076, "Accuracy":"0.7877591584823119", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"BF16\/F32\/F8_E4M3\/U8", "design_power_watts":null, "PrivateID":null }, "341":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius B300 n1 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":112.2858237129, "Accuracy":"0.7876168551420853", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"BF16\/F32\/F8_E4M3\/U8", "design_power_watts":null, "PrivateID":null }, "342":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":73.186054423, "Accuracy":"0.7874581413977274", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"nvfp4, fp8 KV cache", "design_power_watts":null, "PrivateID":null }, "343":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":64.6199522259, "Accuracy":"0.7874065982485451", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"nvfp4, fp8 KV cache", "design_power_watts":null, "PrivateID":null }, "344":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":689961.0, "Accuracy":"exact_match: 80.94804010938924 TOKENS_PER_SAMPLE: 3831.7297174111213", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "345":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":603023.0, "Accuracy":"exact_match: 80.67456700091158 TOKENS_PER_SAMPLE: 3850.7272105742936", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "346":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":1186750.0, "Accuracy":"exact_match: 82.905", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "347":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":1122490.0, "Accuracy":"exact_match: 83.174", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "348":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":132236.0, "Accuracy":"exact_match: 82.975", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "349":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":127921.0, "Accuracy":"exact_match: 83.209", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "350":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius RTX PRO 6000 n1 (8x RTX-PRO-6000-PCIE-96GB, TensorRT)", "Platform":"RTX_PRO_6000_PCIE_96GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":15738.5, "Accuracy":"exact_match: 83.832", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/RTX_PRO_6000_PCIE_96GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.11.0-1016-nvidia", "notes":"KVM virtual machine with 192 vCPUs presented as 2 sockets x 48 cores x 2 threads; 2 virtual NUMA nodes; 8 attached GPUs with 600 W power limit each. nvidia-smi reports CUDA 13.0 driver compatibility; CUDA toolkit and runtime versions are container-specific", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "351":{ "Organization":"Nebius", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius RTX PRO 6000 n1 (8x RTX-PRO-6000-PCIE-96GB, TensorRT)", "Platform":"RTX_PRO_6000_PCIE_96GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":14784.3, "Accuracy":"exact_match: 83.717", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Nebius\/results\/RTX_PRO_6000_PCIE_96GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.11.0-1016-nvidia", "notes":"KVM virtual machine with 192 vCPUs presented as 2 sockets x 48 cores x 2 threads; 2 virtual NUMA nodes; 8 attached GPUs with 600 W power limit each. nvidia-smi reports CUDA 13.0 driver compatibility; CUDA toolkit and runtime versions are container-specific", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "352":{ "Organization":"Nebius", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius VR200 NVL72 (36x VR200-288GB_aarch64, TensorRT)", "Platform":"VR200-NVL72_aarch64x36", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":558802.8293934778, "Accuracy":"81.56335460346399", "number_of_nodes":9, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"352", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":36, "Location":".\/closed\/Nebius\/results\/VR200-NVL72_aarch64x36\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "353":{ "Organization":"Nebius", "Availability":"preview", "Division":"closed", "SystemType":"datacenter", "SystemName":"Nebius VR200 NVL72 (36x VR200-288GB_aarch64, TensorRT)", "Platform":"VR200-NVL72_aarch64x36", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":591368.312764167, "Accuracy":"81.03919781221514", "number_of_nodes":9, "host_processor_model_name":"NVIDIA Vera CPU", "host_processors_per_node":2, "host_processor_core_count":"352", "accelerator_model_name":"NVIDIA VR200", "accelerators_per_node":4, "total_accelerators":36, "Location":".\/closed\/Nebius\/results\/VR200-NVL72_aarch64x36\/deepseek-r1\/Server\/performance\/run_1", "framework":"TRTLLM-rubin, vLLM-CentML:mlperf-inf-mm-q3vl-v6.1, Dynamo", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA VR200 NVL72, 2300W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "354":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"BM.Standard4.Ax.120", "Platform":"1-node-1S-GNR_120C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":853.14, "Accuracy":"ROUGE1: 38.7451 ROUGE2: 16.0022 ROUGEL: 24.5948 ROUGELSUM: 35.807 GEN_LEN: 8190646", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6987P-C", "host_processors_per_node":1, "host_processor_core_count":"120", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Oracle\/results\/1-node-1S-GNR_120C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Oracle-Linux-9.7-2026.06.15-1", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "355":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"BM.Standard4.Ax.120", "Platform":"1-node-1S-GNR_120C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":324.995, "Accuracy":"ROUGE1: 38.7167 ROUGE2: 16.0067 ROUGEL: 24.5623 ROUGELSUM: 35.7763 GEN_LEN: 8199230", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6987P-C", "host_processors_per_node":1, "host_processor_core_count":"120", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Oracle\/results\/1-node-1S-GNR_120C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Oracle-Linux-9.7-2026.06.15-1", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "356":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"BM.Standard4.Ax.120", "Platform":"1-node-1S-GNR_120C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":1099.64, "Accuracy":"ACCURACY: 97.86360951548667", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6987P-C", "host_processors_per_node":1, "host_processor_core_count":"120", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Oracle\/results\/1-node-1S-GNR_120C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Oracle-Linux-9.7-2026.06.15-1", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "357":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":115567.0, "Accuracy":"exact_match: 83.895", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "358":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":109083.0, "Accuracy":"exact_match: 83.679", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "359":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":70421.7, "Accuracy":"ROUGE1: 44.5013 ROUGE2: 22.1522 ROUGEL: 28.9162 TOKENS_PER_SAMPLE: 284.1", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "360":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":101553.0, "Accuracy":"ROUGE1: 44.5168 ROUGE2: 22.1764 ROUGEL: 28.9174 TOKENS_PER_SAMPLE: 284.5", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "361":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":100392.0, "Accuracy":"ROUGE1: 44.5335 ROUGE2: 22.1719 ROUGEL: 28.9333 TOKENS_PER_SAMPLE: 284.1", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "362":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Interactive", "Result":130625.0, "Accuracy":"ROUGE1: 38.5651 ROUGE2: 16.0381 ROUGEL: 24.4433 ROUGELSUM: 35.7047 GEN_LEN: 8150907", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/llama3.1-8b\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "363":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":144321.0, "Accuracy":"ROUGE1: 38.5632 ROUGE2: 16.0256 ROUGEL: 24.4374 ROUGELSUM: 35.7022 GEN_LEN: 8150941", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "364":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":148594.0, "Accuracy":"ROUGE1: 38.5373 ROUGE2: 16.018 ROUGEL: 24.4335 ROUGELSUM: 35.6767 GEN_LEN: 8166290", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/llama3.1-8b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "365":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0706215, "Accuracy":"vbench_score: 69.9515", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "366":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":16.334597792, "Accuracy":"vbench_score: 70.3415", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/8xMI355X_2xEPYC-9575F\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.2", "operating_system":"Ubuntu 22.04.2 LTS (kernel 5.15.0-70-generic)", "notes":"8x AMD Instinct MI355X (gfx950), 288GB HBM3E each. MXFP4 (W4A4) weights with FP8 KV cache, Quark quantization", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Latency (s)", "weight_data_types":"bf16, fp8, fp4", "design_power_watts":null, "PrivateID":null }, "367":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":70354.0, "Accuracy":"exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3810.1563354603463", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "368":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":60745.5, "Accuracy":"exact_match: 81.35824977210574 TOKENS_PER_SAMPLE: 3858.553099361896", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "369":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":109931.0, "Accuracy":"exact_match: 83.311", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "370":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":100608.0, "Accuracy":"exact_match: 83.635", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "371":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":108026.0, "Accuracy":"ROUGE1: 44.7932 ROUGE2: 22.3753 ROUGEL: 29.152 TOKENS_PER_SAMPLE: 272.9", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "372":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":106696.0, "Accuracy":"ROUGE1: 44.8216 ROUGE2: 22.385 ROUGEL: 29.1799 TOKENS_PER_SAMPLE: 272.5", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "373":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":3.994462163, "Accuracy":"0.7876188235945263", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4 weights and activations; FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "374":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":124.3859737873, "Accuracy":"0.7878245382101281", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/B300-SXM-270GBx8_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"NVFP4 weights and activations; FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "375":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":60745.8, "Accuracy":"exact_match: 83.395", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "376":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":59996.0, "Accuracy":"exact_match: 83.331", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "377":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":66001.9, "Accuracy":"ROUGE1: 44.7161 ROUGE2: 22.308 ROUGEL: 29.1704 TOKENS_PER_SAMPLE: 267.0", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "378":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":58991.9, "Accuracy":"ROUGE1: 44.7161 ROUGE2: 22.308 ROUGEL: 29.1704 TOKENS_PER_SAMPLE: 267.0", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "379":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Interactive", "Result":4.9922098076, "Accuracy":"0.7862706307153826", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/qwen3-vl-235b-a22b\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4 weights and activations; FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "380":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":72.7861828181, "Accuracy":"0.7881223292682367", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"NVFP4 weights and activations; FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "381":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":64.6078258994, "Accuracy":"0.7881283191730583", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4 weights and activations; FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "382":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0138372212, "Accuracy":"0.7034961544029444", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "383":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":30.6533598429, "Accuracy":"0.699114664501586", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "384":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Interactive", "Result":235807.0, "Accuracy":"exact_match: 81.28988149498633 TOKENS_PER_SAMPLE: 3770.5820419325432", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Interactive\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "385":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":666613.0, "Accuracy":"exact_match: 81.42661804922516 TOKENS_PER_SAMPLE: 3825.77484047402", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "386":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":586852.0, "Accuracy":"exact_match: 81.38103919781221 TOKENS_PER_SAMPLE: 3780.2771194165907", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "387":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":1097620.0, "Accuracy":"exact_match: 83.395", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "388":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":1092610.0, "Accuracy":"exact_match: 83.331", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "389":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":1297.4909412306, "Accuracy":"0.7868281285145724", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"NVFP4 weights and activations; FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "390":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":1146.3889428926, "Accuracy":"0.7878666850296102", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"NVFP4 weights and activations; FP8 KV cache", "design_power_watts":null, "PrivateID":null }, "391":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.3997628673, "Accuracy":"0.6948773298873472", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "392":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x72_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":5.8954255535, "Accuracy":"0.7028506315560222", "number_of_nodes":18, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":72, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x72_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "393":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":77031.7, "Accuracy":"exact_match: 81.42661804922516 TOKENS_PER_SAMPLE: 3803.590474020055", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "394":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":68138.0, "Accuracy":"exact_match: 80.9024612579763 TOKENS_PER_SAMPLE: 3861.967183226983", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "395":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":132253.0, "Accuracy":"ROUGE1: 44.8005 ROUGE2: 22.3791 ROUGEL: 29.1527 TOKENS_PER_SAMPLE: 272.6", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "396":{ "Organization":"Oracle", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB300 NVL72 (8x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":127984.0, "Accuracy":"ROUGE1: 44.8018 ROUGE2: 22.3668 ROUGEL: 29.141 TOKENS_PER_SAMPLE: 272.9", "number_of_nodes":2, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":8, "Location":".\/closed\/Oracle\/results\/GB300-NVL72_GB300-288GB_aarch64x8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "397":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":1170.51, "Accuracy":"ROUGE1: 38.703 ROUGE2: 15.9823 ROUGEL: 24.5421 ROUGELSUM: 35.7696 GEN_LEN: 8188918", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/1-node-2S-GNR_86C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 25.10", "notes":"QuantaGrid D75E-4U. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "398":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":516.012, "Accuracy":"ROUGE1: 38.6189 ROUGE2: 15.8198 ROUGEL: 24.4192 ROUGELSUM: 35.6324 GEN_LEN: 8192507", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/1-node-2S-GNR_86C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 25.10", "notes":"QuantaGrid D75E-4U. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "399":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"rgat", "MlperfModel":"rgat", "Scenario":"Offline", "Result":15633.3, "Accuracy":"acc: 71.489", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/1-node-2S-GNR_86C\/rgat\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 25.10", "notes":"QuantaGrid D75E-4U. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "400":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":1548.1, "Accuracy":"ACCURACY: 97.89045996917045", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/1-node-2S-GNR_86C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 25.10", "notes":"QuantaGrid D75E-4U. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "401":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":4977.67, "Accuracy":"ROUGE1: 38.8427 ROUGE2: 16.0895 ROUGEL: 24.6432 ROUGELSUM: 35.9449 GEN_LEN: 8127665", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/1-node-4x-BMG-B70\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 25.10", "notes":"QuantaGrid D75E-4U. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "402":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":4122.73, "Accuracy":"ROUGE1: 38.8436 ROUGE2: 16.0905 ROUGEL: 24.6447 ROUGELSUM: 35.9462 GEN_LEN: 8127418", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/1-node-4x-BMG-B70\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 25.10", "notes":"QuantaGrid D75E-4U. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "403":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":5401.23, "Accuracy":"ACCURACY: 97.4509990485252", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/1-node-4x-BMG-B70\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 25.10", "notes":"QuantaGrid D75E-4U. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "404":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":69841.6, "Accuracy":"exact_match: 81.58614402917047 TOKENS_PER_SAMPLE: 3773.390154968095", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "405":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":59622.2, "Accuracy":"exact_match: 81.17593436645396 TOKENS_PER_SAMPLE: 3821.9033728350046", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "406":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":108293.0, "Accuracy":"exact_match: 83.431", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "407":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":100183.0, "Accuracy":"exact_match: 83.451", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "408":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":113985.0, "Accuracy":"ROUGE1: 44.7969 ROUGE2: 22.3741 ROUGEL: 29.152 TOKENS_PER_SAMPLE: 272.6", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "409":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":106285.0, "Accuracy":"ROUGE1: 44.8968 ROUGE2: 22.4583 ROUGEL: 29.2397 TOKENS_PER_SAMPLE: 272.0", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "410":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":131.7949949301, "Accuracy":"0.7880292841897505", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "411":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":104.8118239643, "Accuracy":"0.7875545886602456", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "412":{ "Organization":"Quanta_Cloud_Technology", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"QuantaGrid D75H-10U (8x B300-SXM-270GB, TensorRT)", "Platform":"D75H-10U_B300-270GBx8_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":45408.2, "Accuracy":"ACCURACY: 97.82350086127316", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Quanta_Cloud_Technology\/results\/D75H-10U_B300-270GBx8_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Rocky Linux 10.1", "notes":"QuantaGrid D75H-10U", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "413":{ "Organization":"RedHat_Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_96C", "Platform":"1-node-2S-GNR_96C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":1507.21, "Accuracy":"ROUGE1: 38.7872 ROUGE2: 16.0024 ROUGEL: 24.5918 ROUGELSUM: 35.7668 GEN_LEN: 8190420", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6972P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/RedHat_Intel\/results\/1-node-2S-GNR_96C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"RHEL 9.9", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "414":{ "Organization":"RedHat_Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_96C", "Platform":"1-node-2S-GNR_96C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":644.788, "Accuracy":"ROUGE1: 38.606 ROUGE2: 15.7593 ROUGEL: 24.3946 ROUGELSUM: 35.6342 GEN_LEN: 8185295", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6972P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/RedHat_Intel\/results\/1-node-2S-GNR_96C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"RHEL 9.9", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "415":{ "Organization":"RedHat_Intel", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_96C", "Platform":"1-node-2S-GNR_96C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":1966.11, "Accuracy":"ACCURACY: 97.86193444026833", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6972P", "host_processors_per_node":2, "host_processor_core_count":"96", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/RedHat_Intel\/results\/1-node-2S-GNR_96C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"RHEL 9.9", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "416":{ "Organization":"RedHat_Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL4 (4x GB200-192GB_aarch64, vLLM)", "Platform":"GB200-NVL4-192GB_aarch64x4_VLLM", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":58.0779840125, "Accuracy":"0.7874682472480947", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/RedHat_Supermicro\/results\/GB200-NVL4-192GB_aarch64x4_VLLM\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"vLLM v0.20.2rc1.dev2091, CUDA 13.0.1, NVIDIA Dynamo, PyTorch 2.11.0+cu130", "operating_system":"Red Hat Enterprise Linux 9.8", "notes":"NVIDIA GB200 NVL4, 1200W TGP Per GPU, Supermicro chassis", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "417":{ "Organization":"RedHat_Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL4 (4x GB200-192GB_aarch64, vLLM)", "Platform":"GB200-NVL4-192GB_aarch64x4_VLLM", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":50.6837895895, "Accuracy":"0.7877985363200543", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/RedHat_Supermicro\/results\/GB200-NVL4-192GB_aarch64x4_VLLM\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"vLLM v0.20.2rc1.dev2091, CUDA 13.0.1, NVIDIA Dynamo, PyTorch 2.11.0+cu130", "operating_system":"Red Hat Enterprise Linux 9.8", "notes":"NVIDIA GB200 NVL4, 1200W TGP Per GPU, Supermicro chassis", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "418":{ "Organization":"RedHat_Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SMC Lab OpenShift GB200-NVL4 4xGB200-186GB", "Platform":"GB200-NVL4_186GB_Openshift_VLLM", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":61205.6, "Accuracy":"exact_match: 83.695", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/RedHat_Supermicro\/results\/GB200-NVL4_186GB_Openshift_VLLM\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.24.0, Red Hat OpenShift 4.21", "operating_system":"Red Hat Enterprise Linux CoreOS 9.6", "notes":"NVIDIA GB200 NVL4 with 2x Grace CPUs (72 ARM cores each), 4x GB200 GPUs (189GB HBM3e each). SMC Lab, Red Hat OpenShift 4.21, RHEL CoreOS 9.6, vLLM 0.24.0", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "419":{ "Organization":"RedHat_Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SMC Lab OpenShift GB200-NVL4 4xGB200-186GB", "Platform":"GB200-NVL4_186GB_Openshift_VLLM", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":51095.2, "Accuracy":"exact_match: 83.948", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"72", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/RedHat_Supermicro\/results\/GB200-NVL4_186GB_Openshift_VLLM\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.24.0, Red Hat OpenShift 4.21", "operating_system":"Red Hat Enterprise Linux CoreOS 9.6", "notes":"NVIDIA GB200 NVL4 with 2x Grace CPUs (72 ARM cores each), 4x GB200 GPUs (189GB HBM3e each). SMC Lab, Red Hat OpenShift 4.21, RHEL CoreOS 9.6, vLLM 0.24.0", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "420":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_128C", "Platform":"1-node-2S-GNR_128C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":1833.97, "Accuracy":"ROUGE1: 38.6493 ROUGE2: 15.8388 ROUGEL: 24.4665 ROUGELSUM: 35.6409 GEN_LEN: 8186666", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-2S-GNR_128C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":"SYS-422GA-NRT. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "421":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_128C", "Platform":"1-node-2S-GNR_128C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":1101.19, "Accuracy":"ROUGE1: 38.7236 ROUGE2: 15.8895 ROUGEL: 24.4948 ROUGELSUM: 35.7134 GEN_LEN: 8199179", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-2S-GNR_128C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":"SYS-422GA-NRT. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "422":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_128C", "Platform":"1-node-2S-GNR_128C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":2248.15, "Accuracy":"ACCURACY: 97.89525766917866", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6980P", "host_processors_per_node":2, "host_processor_core_count":"128", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-2S-GNR_128C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":"SYS-422GA-NRT. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "423":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":1189.89, "Accuracy":"ROUGE1: 38.7008 ROUGE2: 15.8479 ROUGEL: 24.4355 ROUGELSUM: 35.7034 GEN_LEN: 8193707", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-2S-GNR_86C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":"SYS-422GB-NRT. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "424":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":516.059, "Accuracy":"ROUGE1: 38.7059 ROUGE2: 15.8614 ROUGEL: 24.4785 ROUGELSUM: 35.726 GEN_LEN: 8175493", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-2S-GNR_86C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":"SYS-422GB-NRT. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "425":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"rgat", "MlperfModel":"rgat", "Scenario":"Offline", "Result":13273.7, "Accuracy":"acc: 72.520", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-2S-GNR_86C\/rgat\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":"SYS-422GB-NRT. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "426":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-2S-GNR_86C", "Platform":"1-node-2S-GNR_86C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":1477.4, "Accuracy":"ACCURACY: 97.89045996917045", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6787P", "host_processors_per_node":2, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-2S-GNR_86C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3", "notes":"SYS-422GB-NRT. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "427":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4S-GNR_86C", "Platform":"1-node-4S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":2063.24, "Accuracy":"ROUGE1: 38.5949 ROUGE2: 15.7867 ROUGEL: 24.3919 ROUGELSUM: 35.6229 GEN_LEN: 8190845", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":4, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-4S-GNR_86C\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"SYS-442B-NR. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "428":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4S-GNR_86C", "Platform":"1-node-4S-GNR_86C", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":966.241, "Accuracy":"ROUGE1: 38.7724 ROUGE2: 16.0093 ROUGEL: 24.5982 ROUGELSUM: 35.8002 GEN_LEN: 8168484", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":4, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-4S-GNR_86C\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"SYS-442B-NR. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "429":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4S-GNR_86C", "Platform":"1-node-4S-GNR_86C", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":2881.28, "Accuracy":"ACCURACY: 97.9447557970256", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6788P", "host_processors_per_node":4, "host_processor_core_count":"86", "accelerator_model_name":null, "accelerators_per_node":0, "total_accelerators":0, "Location":".\/closed\/Supermicro\/results\/1-node-4S-GNR_86C\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"SYS-442B-NR. N\/A", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "430":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":2063.93, "Accuracy":"exact_match: 83.780", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6731P", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Supermicro\/results\/1-node-4x-BMG-B70\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"MXFP4", "design_power_watts":null, "PrivateID":null }, "431":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":1351.13, "Accuracy":"exact_match: 84.186", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6731P", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Supermicro\/results\/1-node-4x-BMG-B70\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"MXFP4", "design_power_watts":null, "PrivateID":null }, "432":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":2484.14, "Accuracy":"ROUGE1: 44.585 ROUGE2: 22.2008 ROUGEL: 28.8241 TOKENS_PER_SAMPLE: 290.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6731P", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Supermicro\/results\/1-node-4x-BMG-B70\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "433":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":1759.95, "Accuracy":"ROUGE1: 44.591 ROUGE2: 22.2044 ROUGEL: 28.8277 TOKENS_PER_SAMPLE: 290.8", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6731P", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Supermicro\/results\/1-node-4x-BMG-B70\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "434":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":4596.62, "Accuracy":"ROUGE1: 38.8447 ROUGE2: 16.0909 ROUGEL: 24.6442 ROUGELSUM: 35.9477 GEN_LEN: 8127563", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6731P", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Supermicro\/results\/1-node-4x-BMG-B70\/llama3_1-8b\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "435":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"llama3_1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":4208.73, "Accuracy":"ROUGE1: 38.8128 ROUGE2: 16.082 ROUGEL: 24.6384 ROUGELSUM: 35.9155 GEN_LEN: 8126189", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6731P", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Supermicro\/results\/1-node-4x-BMG-B70\/llama3_1-8b\/Server\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "436":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"1-node-4x-BMG-B70", "Platform":"1-node-4x-BMG-B70", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":5854.85, "Accuracy":"ACCURACY: 97.49980776624375", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6731P", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"Intel(R) Arc(TM) Pro B70", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Supermicro\/results\/1-node-4x-BMG-B70\/whisper\/Offline\/performance\/run_1", "framework":"PyTorch", "operating_system":"Ubuntu 24.04.4 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"INT8", "design_power_watts":null, "PrivateID":null }, "437":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-4126GS-NMR-LCC", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":117005.0, "Accuracy":"exact_match: 83.113", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/8xMI355X_2xEPYC-9575F\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4", "operating_system":"Ubuntu 26.04 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "438":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-4126GS-NMR-LCC", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":109184.0, "Accuracy":"exact_match: 83.861", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/8xMI355X_2xEPYC-9575F\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4", "operating_system":"Ubuntu 26.04 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "439":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-4126GS-NMR-LCC", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Interactive", "Result":73181.5, "Accuracy":"ROUGE1: 44.507 ROUGE2: 22.1597 ROUGEL: 28.9194 TOKENS_PER_SAMPLE: 284.1", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/8xMI355X_2xEPYC-9575F\/llama2-70b-99.9\/Interactive\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4", "operating_system":"Ubuntu 26.04 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "440":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-4126GS-NMR-LCC", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":102243.0, "Accuracy":"ROUGE1: 44.5269 ROUGE2: 22.1836 ROUGEL: 28.9207 TOKENS_PER_SAMPLE: 284.3", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/8xMI355X_2xEPYC-9575F\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4", "operating_system":"Ubuntu 26.04 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "441":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-4126GS-NMR-LCC", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":103032.0, "Accuracy":"ROUGE1: 44.5345 ROUGE2: 22.1731 ROUGEL: 28.933 TOKENS_PER_SAMPLE: 284.0", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/8xMI355X_2xEPYC-9575F\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4", "operating_system":"Ubuntu 26.04 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "442":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-4126GS-NMR-LCC", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":159060.0, "Accuracy":"ROUGE1: 38.5437 ROUGE2: 16.0099 ROUGEL: 24.4209 ROUGELSUM: 35.6859 GEN_LEN: 8150015", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/8xMI355X_2xEPYC-9575F\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4", "operating_system":"Ubuntu 26.04 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "443":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-4126GS-NMR-LCC", "Platform":"8xMI355X_2xEPYC-9575F", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":148710.0, "Accuracy":"ROUGE1: 38.5048 ROUGE2: 15.9985 ROUGEL: 24.4065 ROUGELSUM: 35.652 GEN_LEN: 8176781", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"AMD Instinct MI355X 288GB HBM3e", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/8xMI355X_2xEPYC-9575F\/llama3.1-8b\/Server\/performance\/run_1", "framework":"vLLM 0.22.0, PyTorch 2.10.0, ROCm 7.2.4", "operating_system":"Ubuntu 26.04 LTS", "notes":null, "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "444":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-8126GS-NB3RT", "Platform":"AS-8126GS-NB3RT_B300-SXM-288GB_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":69830.0, "Accuracy":"exact_match: 80.78851412944394 TOKENS_PER_SAMPLE: 3839.5469462169553", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/AS-8126GS-NB3RT_B300-SXM-288GB_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "445":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-8126GS-NB3RT", "Platform":"AS-8126GS-NB3RT_B300-SXM-288GB_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":61164.9, "Accuracy":"exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3850.996809480401", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/AS-8126GS-NB3RT_B300-SXM-288GB_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "446":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-8126GS-NB3RT", "Platform":"AS-8126GS-NB3RT_B300-SXM-288GB_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":108727.0, "Accuracy":"exact_match: 83.743", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/AS-8126GS-NB3RT_B300-SXM-288GB_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "447":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-8126GS-NB3RT", "Platform":"AS-8126GS-NB3RT_B300-SXM-288GB_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":107288.0, "Accuracy":"exact_match: 83.354", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/AS-8126GS-NB3RT_B300-SXM-288GB_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "448":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-8126GS-NB3RT", "Platform":"AS-8126GS-NB3RT_B300-SXM-288GB_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":110802.0, "Accuracy":"ROUGE1: 44.8018 ROUGE2: 22.3841 ROUGEL: 29.1588 TOKENS_PER_SAMPLE: 272.7", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/AS-8126GS-NB3RT_B300-SXM-288GB_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "449":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"AS-8126GS-NB3RT", "Platform":"AS-8126GS-NB3RT_B300-SXM-288GB_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":106872.0, "Accuracy":"ROUGE1: 44.828 ROUGE2: 22.4004 ROUGEL: 29.1931 TOKENS_PER_SAMPLE: 272.0", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/AS-8126GS-NB3RT_B300-SXM-288GB_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "450":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":69104.0, "Accuracy":"exact_match: 81.58614402917047 TOKENS_PER_SAMPLE: 3787.6494986326343", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "451":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":66754.3, "Accuracy":"exact_match: 80.92525068368278 TOKENS_PER_SAMPLE: 3729.1365086599817", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "452":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":107851.0, "Accuracy":"exact_match: 83.592", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "453":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":107205.0, "Accuracy":"exact_match: 83.457", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "454":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":111247.0, "Accuracy":"ROUGE1: 44.7966 ROUGE2: 22.3806 ROUGEL: 29.1557 TOKENS_PER_SAMPLE: 272.7", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "455":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":109848.0, "Accuracy":"ROUGE1: 44.799 ROUGE2: 22.3988 ROUGEL: 29.1884 TOKENS_PER_SAMPLE: 272.3", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "456":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":128.90612412, "Accuracy":"0.7870632563988416", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"BF16\/F8_E4M3\/U8", "design_power_watts":null, "PrivateID":null }, "457":{ "Organization":"Supermicro", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"SYS-822GS-NB3RT", "Platform":"SYS-822GS-NB3RT", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Server", "Result":111.7738365068, "Accuracy":"0.7871852181615411", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/Supermicro\/results\/SYS-822GS-NB3RT\/qwen3-vl-235b-a22b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Queries\/s", "weight_data_types":"BF16\/F8_E4M3\/U8", "design_power_watts":null, "PrivateID":null }, "458":{ "Organization":"TTA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"ManyCoreSoft DeepGadget dg5W (4x NVIDIA RTX PRO 6000 Blackwell 96GB, TensorRT)", "Platform":"DeepGadget_dg5W_RTXPro6000_96GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":24511.8, "Accuracy":"ROUGE1: 38.5238 ROUGE2: 15.9869 ROUGEL: 24.3988 ROUGELSUM: 35.6579 GEN_LEN: 8178576", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9124", "host_processors_per_node":1, "host_processor_core_count":"16", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/TTA\/results\/DeepGadget_dg5W_RTXPro6000_96GBx4_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14.1.48, CUDA 13.1", "operating_system":"Rocky Linux 9.7", "notes":"DeepGadget dg5W; ManyCoreSoft dg5W (SKU2-T1) chassis, GENOAD8X-2T\/BCM mainboard; 4x NVIDIA RTX PRO 6000 Blackwell Server Edition (TGP 600W each); direct liquid cooling (DLC)", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "459":{ "Organization":"TTA", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"ManyCoreSoft DeepGadget dg5W (4x NVIDIA RTX PRO 6000 Blackwell 96GB, TensorRT)", "Platform":"DeepGadget_dg5W_RTXPro6000_96GBx4_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":24510.5, "Accuracy":"ROUGE1: 38.5242 ROUGE2: 15.9887 ROUGEL: 24.3995 ROUGELSUM: 35.6582 GEN_LEN: 8178682", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9124", "host_processors_per_node":1, "host_processor_core_count":"16", "accelerator_model_name":"NVIDIA RTX PRO 6000 Blackwell Server Edition", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/TTA\/results\/DeepGadget_dg5W_RTXPro6000_96GBx4_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14.1.48, CUDA 13.1", "operating_system":"Rocky Linux 9.7", "notes":"DeepGadget dg5W; ManyCoreSoft dg5W (SKU2-T1) chassis, GENOAD8X-2T\/BCM mainboard; 4x NVIDIA RTX PRO 6000 Blackwell Server Edition (TGP 600W each); direct liquid cooling (DLC)", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "460":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"B300-SXM-270GBx1_TRT", "Platform":"B300-SXM-270GBx1_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":14130.6, "Accuracy":"exact_match: 83.235", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx1_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "461":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"B300-SXM-270GBx1_TRT", "Platform":"B300-SXM-270GBx1_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":13854.0, "Accuracy":"exact_match: 83.289", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx1_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "462":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"B300-SXM-270GBx1_TRT", "Platform":"B300-SXM-270GBx1_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":14636.8, "Accuracy":"ROUGE1: 44.781 ROUGE2: 22.3679 ROUGEL: 29.1539 TOKENS_PER_SAMPLE: 273.1", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx1_TRT\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "463":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"B300-SXM-270GBx1_TRT", "Platform":"B300-SXM-270GBx1_TRT", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Server", "Result":14495.6, "Accuracy":"ROUGE1: 44.7255 ROUGE2: 22.327 ROUGEL: 29.1172 TOKENS_PER_SAMPLE: 274.2", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx1_TRT\/llama2-70b-99.9\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "464":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"B300-SXM-270GBx1_TRT", "Platform":"B300-SXM-270GBx1_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":21266.1, "Accuracy":"ROUGE1: 38.5346 ROUGE2: 15.7631 ROUGEL: 24.3218 ROUGELSUM: 35.5543 GEN_LEN: 8191123", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx1_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "465":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"B300-SXM-270GBx1_TRT", "Platform":"B300-SXM-270GBx1_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":20420.4, "Accuracy":"ROUGE1: 38.5378 ROUGE2: 15.764 ROUGEL: 24.3237 ROUGELSUM: 35.5571 GEN_LEN: 8191033", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx1_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "466":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"B300-SXM-270GBx1_TRT", "Platform":"B300-SXM-270GBx1_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":7058.95, "Accuracy":"ACCURACY: 97.85680976807484", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx1_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "467":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":36639.6, "Accuracy":"exact_match: 81.22151321786691 TOKENS_PER_SAMPLE: 3770.8865086599817", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "468":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":33415.2, "Accuracy":"exact_match: 81.83682771194167 TOKENS_PER_SAMPLE: 3750.4530537830447", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "469":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":161767.0, "Accuracy":"ROUGE1: 38.5395 ROUGE2: 15.7648 ROUGEL: 24.3262 ROUGELSUM: 35.5597 GEN_LEN: 8190944", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx8_TRT\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "470":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Server", "Result":156867.0, "Accuracy":"ROUGE1: 38.5355 ROUGE2: 15.7593 ROUGEL: 24.3212 ROUGELSUM: 35.5549 GEN_LEN: 8191008", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx8_TRT\/llama3.1-8b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "471":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"Offline", "Result":0.0783824, "Accuracy":"vbench_score: 70.1187", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "472":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"wan-2.2-t2v-a14b", "MlperfModel":"text_to_video", "Scenario":"SingleStream", "Result":21.279754716, "Accuracy":"vbench_score: 70.3113", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx8_TRT\/wan-2.2-t2v-a14b\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Latency (s)", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "473":{ "Organization":"VibeHPC", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"NVIDIA DGX B300 (8x B300-SXM-270GB, TensorRT)", "Platform":"B300-SXM-270GBx8_TRT", "Model":"whisper", "MlperfModel":"whisper", "Scenario":"Offline", "Result":53267.2, "Accuracy":"ACCURACY: 97.85680976807484", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/closed\/VibeHPC\/results\/B300-SXM-270GBx8_TRT\/whisper\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1", "operating_system":"Ubuntu 24.04", "notes":"B300 TGP 1100W", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16", "design_power_watts":null, "PrivateID":null }, "474":{ "Organization":"Wiwynn", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"OneW GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Offline", "Result":63990.5, "Accuracy":"exact_match: 83.440", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Wiwynn\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/gpt-oss-120b\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "475":{ "Organization":"Wiwynn", "Availability":"available", "Division":"closed", "SystemType":"datacenter", "SystemName":"OneW GB300 NVL72 (4x GB300-288GB_aarch64, TensorRT)", "Platform":"GB300-NVL72_GB300-288GB_aarch64x4_TRT", "Model":"gpt-oss-120b", "MlperfModel":"gpt-oss-120b", "Scenario":"Server", "Result":60466.2, "Accuracy":"exact_match: 83.187", "number_of_nodes":1, "host_processor_model_name":"NVIDIA Grace CPU", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB300", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/closed\/Wiwynn\/results\/GB300-NVL72_GB300-288GB_aarch64x4_TRT\/gpt-oss-120b\/Server\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat\/1.2-mlpinf", "operating_system":"Ubuntu 24.04", "notes":"NVIDIA GB300 NVL72, 1400W TGP Per GPU", "compliance":"closed", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "476":{ "Organization":"AMD", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Offline", "Result":16363.0, "Accuracy":"DLRM_NE: 0.8678795984098008 DLRM_ACC: 0.6962884623080815 DLRM_AUC: 0.7861666437936649", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64 cores per socket, 128 total cores, 256 threads", "accelerator_model_name":"AMD Instinct MI355X", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/open\/AMD\/results\/8xMI355X_2xEPYC_9575F\/dlrm-v3\/Offline\/performance\/run_1", "framework":"PyTorch 2.10.0+rocm7.2.3.git1a270074, Triton 3.6.0, ROCm 7.2.3", "operating_system":"Ubuntu 24.04.3 LTS (Noble Numbat), kernel 6.8.0-134-generic", "notes":"Measured on current chi2810-class host reporting hostname chi2878: 8x MI355X \/ 2x EPYC 9575F, 256 online CPUs, SMT enabled, CPU governor performance. Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm C1-on stack: HSTU sliding-window attention (window 1024), batch 64, degree-5 SiLU gate, uniform-target metadata, and FP8 quantization. MLPerf Inference v6.1 seeds with LoadGen 6.0.17. Server target 16,200 q\/s; Offline target 17,000 q\/s.", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Samples\/s", "weight_data_types":"fp16,bf16,fp8", "design_power_watts":null, "PrivateID":null }, "477":{ "Organization":"AMD", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"8xMI355X_2xEPYC_9575F", "Platform":"8xMI355X_2xEPYC_9575F", "Model":"dlrm-v3", "MlperfModel":"dlrm-v3", "Scenario":"Server", "Result":16194.4, "Accuracy":"DLRM_NE: 0.8678772746839061 DLRM_ACC: 0.6962803331970739 DLRM_AUC: 0.7861629372250531", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9575F", "host_processors_per_node":2, "host_processor_core_count":"64 cores per socket, 128 total cores, 256 threads", "accelerator_model_name":"AMD Instinct MI355X", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/open\/AMD\/results\/8xMI355X_2xEPYC_9575F\/dlrm-v3\/Server\/performance\/run_1", "framework":"PyTorch 2.10.0+rocm7.2.3.git1a270074, Triton 3.6.0, ROCm 7.2.3", "operating_system":"Ubuntu 24.04.3 LTS (Noble Numbat), kernel 6.8.0-134-generic", "notes":"Measured on current chi2810-class host reporting hostname chi2878: 8x MI355X \/ 2x EPYC 9575F, 256 online CPUs, SMT enabled, CPU governor performance. Known-good host KMD floor: amdgpu 6.16.6 or newer.. DLRM-v3 ROCm C1-on stack: HSTU sliding-window attention (window 1024), batch 64, degree-5 SiLU gate, uniform-target metadata, and FP8 quantization. MLPerf Inference v6.1 seeds with LoadGen 6.0.17. Server target 16,200 q\/s; Offline target 17,000 q\/s.", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Queries\/s", "weight_data_types":"fp16,bf16,fp8", "design_power_watts":null, "PrivateID":null }, "478":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 by HPE (16x GB200-186GB_aarch64, TensorRT)", "Platform":"HPE_GB200-NVL72_GB200-186GB_aarch64x16_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":126223.0, "Accuracy":"exact_match: 81.38103919781221 TOKENS_PER_SAMPLE: 3823.224020054695", "number_of_nodes":4, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":16, "Location":".\/open\/HPE\/results\/HPE_GB200-NVL72_GB200-186GB_aarch64x16_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k", "notes":"NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Two dep8 replicas across four nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "479":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 by HPE (32x GB200-186GB_aarch64, TensorRT)", "Platform":"HPE_GB200-NVL72_GB200-186GB_aarch64x32_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":245352.0, "Accuracy":"exact_match: 81.8824065633546 TOKENS_PER_SAMPLE: 3798.4737921604374", "number_of_nodes":8, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":32, "Location":".\/open\/HPE\/results\/HPE_GB200-NVL72_GB200-186GB_aarch64x32_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k", "notes":"NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. Four dep8 replicas across eight nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "480":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"NVIDIA GB200 NVL72 by HPE (56x GB200-186GB_aarch64, TensorRT)", "Platform":"HPE_GB200-NVL72_GB200-186GB_aarch64x56_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":336125.0, "Accuracy":"exact_match: 80.9936189608022 TOKENS_PER_SAMPLE: 3836.976071103008", "number_of_nodes":14, "host_processor_model_name":"NVIDIA Grace CPU (Arm Neoverse-V2)", "host_processors_per_node":2, "host_processor_core_count":"144", "accelerator_model_name":"NVIDIA GB200", "accelerators_per_node":4, "total_accelerators":56, "Location":".\/open\/HPE\/results\/HPE_GB200-NVL72_GB200-186GB_aarch64x56_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.1, TensorRT-LLM 1.3.0rc0", "operating_system":"Ubuntu 24.04.4 LTS, Linux 6.14.0-37-generic-64k", "notes":"NVIDIA GB200 NVL72 platform by HPE; 1200 W GPU power limit. The LoadGen task shares one inference node CPU allocation and is not an additional SUT node.. Seven dep8 replicas across fourteen inference nodes; CentML DeepSeek-R1 NVFP4 v2 checkpoint", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "481":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"edge", "SystemName":"HPE ProLiant DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB, TensorRT)", "Platform":"HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open", "Model":"llama3.1-8b-edge", "MlperfModel":"llama3.1-8b-edge", "Scenario":"Offline", "Result":9557.69, "Accuracy":"ROUGE1: 38.7947 ROUGE2: 16.0822 ROUGEL: 24.5817 ROUGELSUM: 35.7134 GEN_LEN: 8173143", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9375F 32-Core Processor", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/open\/HPE\/results\/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open\/llama3.1-8b-edge\/Offline\/performance\/run_1", "framework":"TensorRT 10.15.1.29, CUDA 13.2", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "482":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"edge", "SystemName":"HPE ProLiant DL345 Gen12 (4x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB, TensorRT)", "Platform":"HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open", "Model":"llama3.1-8b-edge", "MlperfModel":"llama3.1-8b-edge", "Scenario":"SingleStream", "Result":1203.785699, "Accuracy":"ROUGE1: 38.7883 ROUGE2: 16.056 ROUGEL: 24.5055 ROUGELSUM: 35.724 GEN_LEN: 8183134", "number_of_nodes":1, "host_processor_model_name":"AMD EPYC 9375F 32-Core Processor", "host_processors_per_node":1, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB", "accelerators_per_node":4, "total_accelerators":4, "Location":".\/open\/HPE\/results\/HPE_PROLIANT_DL345_GEN12_RTX_PRO_4500_PCIE_32GBx4_TRT_open\/llama3.1-8b-edge\/SingleStream\/performance\/run_1", "framework":"TensorRT 10.15.1.29, CUDA 13.2", "operating_system":"Ubuntu 24.04.4", "notes":null, "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "483":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB)", "Platform":"HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open", "Model":"resnet50", "MlperfModel":"resnet", "Scenario":"multistream", "Result":5.030642, "Accuracy":"acc: 77.805", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6762P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/open\/HPE\/results\/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open\/resnet50\/multistream\/performance\/run_1", "framework":"ONNX Runtime v1.28.0", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"open", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "484":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"edge", "SystemName":"HPE ProLiant Compute DL380 Gen12 (1x NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB)", "Platform":"HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open", "Model":"resnet50", "MlperfModel":"resnet", "Scenario":"singlestream", "Result":1.480867, "Accuracy":"acc: 77.536", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6762P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA RTX PRO 4500 Blackwell-PCIe-32GB", "accelerators_per_node":1, "total_accelerators":1, "Location":".\/open\/HPE\/results\/HPE_PROLIANT_DL380_RTX_PRO_4500_PCIE_32GBx1_TRT_open\/resnet50\/singlestream\/performance\/run_1", "framework":"ONNX Runtime v1.28.0", "operating_system":"Ubuntu 24.04.3", "notes":null, "compliance":"open", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp32", "design_power_watts":null, "PrivateID":null }, "485":{ "Organization":"HPE", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"HPE Compute XD690 (8x NVIDIA B300-SXM-270GB, TensorRT)", "Platform":"HPE_XD690_B300_SXM_270GBx8_TRT_open", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":71053.4, "Accuracy":"exact_match: 81.08477666362808 TOKENS_PER_SAMPLE: 3818.841841385597", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6776P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B300-SXM-270GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/open\/HPE\/results\/HPE_XD690_B300_SXM_270GBx8_TRT_open\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT 10.14, CUDA 13.2", "operating_system":"RHEL 9.4", "notes":"B300 TGP 1100W", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "486":{ "Organization":"Krai", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"HPE Cray XD670 (8x H200-SXM-141GB, Krai\/Gentic)", "Platform":"h200", "Model":"qwen3-vl-235b-a22b", "MlperfModel":"VLM", "Scenario":"Offline", "Result":9.2216804291, "Accuracy":"0.7878368975913989", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8562Y+", "host_processors_per_node":2, "host_processor_core_count":"32", "accelerator_model_name":"NVIDIA H200-SXM-141GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/open\/Krai\/results\/h200\/qwen3-vl-235b-a22b\/Offline\/performance\/run_1", "framework":"Krai\/Gentic", "operating_system":"Red Hat Enterprise Linux release 9.4 (Plow) (Linux kernel: 5.14.0-427.13.1.el9_4.x86_64 #1 SMP PREEMPT_DYNAMIC Wed Apr 10 10:29:16 EDT 2024 x86_64 x86_64 x86_64 GNU\/Linux)", "notes":"Powered by Krai\/Gentic, next-gen automation", "compliance":"open", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Samples\/s", "weight_data_types":"bf16", "design_power_watts":null, "PrivateID":null }, "487":{ "Organization":"Lambda", "Availability":"available", "Division":"open", "SystemType":"edge", "SystemName":"Lambda 8x B200-SXM-180GB (SGLang, Kimi-K2.6 edge-agentic \/ BFCL v4)", "Platform":"B200-SXM-180GBx8_SGLANG", "Model":"qwen3.6-27b", "MlperfModel":"agentic edge", "Scenario":"SingleStream", "Result":770.8277659603, "Accuracy":"0.8683417085427135", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) Platinum 8570", "host_processors_per_node":2, "host_processor_core_count":"56", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/open\/Lambda\/results\/B200-SXM-180GBx8_SGLANG\/qwen3.6-27b\/SingleStream\/performance\/run_1", "framework":"SGLang 0.5.15.post1, CUDA 13.0", "operating_system":"Ubuntu 24.04.4 LTS", "notes":"8x B200-SXM-180GB (Blackwell). OPEN division. Model = moonshotai\/Kimi-K2.6 (kimi_k25, fp8), served with SGLang TP=8 on 8x B200, reasoning disabled (chat_template thinking=false, the reference 'reasoning off' analog). Workload = the MLPerf edge-agentic reference (mlcommons\/endpoints example 11_Edge_Agentic_Example): BFCL v4 single-turn function-calling accuracy + agentic-coding inline-checker performance replay, all reference invariants unchanged (temperature 0, max_new_tokens 1024, single-stream). Benchmark labeled kimi-k2.6-edge-agentic. All metrics are Kimi-K2.6's real measured numbers.", "compliance":"open", "errors":0, "version":"v6.1", "inferred":1, "has_power":false, "Units":"Latency (ms)", "weight_data_types":"fp8", "design_power_watts":null, "PrivateID":null }, "488":{ "Organization":"Orrick Industries LLC", "Availability":"rdi", "Division":"open", "SystemType":"datacenter", "SystemName":"Orrick Optimized 6x NVIDIA B200", "Platform":"b200_6x", "Model":"llama3.1-8b", "MlperfModel":"llama3.1-8b", "Scenario":"Offline", "Result":274927.0, "Accuracy":"ROUGE1: 36.869 ROUGE2: 14.1535 ROUGEL: 23.5033 ROUGELSUM: 33.7502", "number_of_nodes":1, "host_processor_model_name":"INTEL(R) XEON(R) PLATINUM 8568Y+", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":6, "total_accelerators":6, "Location":".\/open\/Orrick Industries LLC\/results\/b200_6x\/llama3.1-8b\/Offline\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc20", "operating_system":"Ubuntu 24.04.3 LTS (container)", "notes":"6x NVIDIA B200, rented cloud instance. Orrick proprietary inference optimization. NVFP4 weights with FP8 KV cache. Implementation details are proprietary and not disclosed.", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"nvfp4", "design_power_watts":null, "PrivateID":null }, "489":{ "Organization":"Orrick Industries LLC", "Availability":"rdi", "Division":"open", "SystemType":"datacenter", "SystemName":"Orrick Optimized 6x NVIDIA B200 L2", "Platform":"b200_l2_6x", "Model":"llama2-70b-99.9", "MlperfModel":"llama2-70b-99.9", "Scenario":"Offline", "Result":130928.0, "Accuracy":"ROUGE1: 41.797 ROUGE2: 19.7311 ROUGEL: 26.6864 TOKENS_PER_SAMPLE: 281.9", "number_of_nodes":1, "host_processor_model_name":"INTEL(R) XEON(R) PLATINUM 8568Y+", "host_processors_per_node":2, "host_processor_core_count":"48", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":6, "total_accelerators":6, "Location":".\/open\/Orrick Industries LLC\/results\/b200_l2_6x\/llama2-70b-99.9\/Offline\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc20", "operating_system":"Ubuntu 24.04.3 LTS (container)", "notes":"6x NVIDIA B200, rented cloud instance. Orrick proprietary inference optimization. NVFP4 weights with FP8 KV cache. Implementation details are proprietary and not disclosed.", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"nvfp4", "design_power_watts":null, "PrivateID":null }, "490":{ "Organization":"ScitiX", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"ScitiX B200 (8x B200-SXM-180GB, TensorRT-LLM)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Offline", "Result":60410.9, "Accuracy":"exact_match: 81.70009115770283 TOKENS_PER_SAMPLE: 3727.5230173199634", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/open\/ScitiX\/results\/B200-SXM-180GBx8_TRT\/deepseek-r1\/Offline\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc0, CUDA 13.1", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Closed division; DeepSeek-R1 NVFP4 weights + FP8 KV; aggregated 8-GPU TP=8 with MTP (num_nextn_predict_layers=1) speculative decoding", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null }, "491":{ "Organization":"ScitiX", "Availability":"available", "Division":"open", "SystemType":"datacenter", "SystemName":"ScitiX B200 (8x B200-SXM-180GB, TensorRT-LLM)", "Platform":"B200-SXM-180GBx8_TRT", "Model":"deepseek-r1", "MlperfModel":"deepseek-r1", "Scenario":"Server", "Result":59668.3, "Accuracy":"exact_match: 81.17593436645396 TOKENS_PER_SAMPLE: 3739.3393345487693", "number_of_nodes":1, "host_processor_model_name":"Intel(R) Xeon(R) 6767P", "host_processors_per_node":2, "host_processor_core_count":"64", "accelerator_model_name":"NVIDIA B200-SXM-180GB", "accelerators_per_node":8, "total_accelerators":8, "Location":".\/open\/ScitiX\/results\/B200-SXM-180GBx8_TRT\/deepseek-r1\/Server\/performance\/run_1", "framework":"TensorRT-LLM 1.3.0rc0, CUDA 13.1", "operating_system":"Ubuntu 24.04.3 LTS", "notes":"Closed division; DeepSeek-R1 NVFP4 weights + FP8 KV; aggregated 8-GPU TP=8 with MTP (num_nextn_predict_layers=1) speculative decoding", "compliance":"open", "errors":0, "version":"v6.1", "inferred":0, "has_power":false, "Units":"Tokens\/s", "weight_data_types":"fp4", "design_power_watts":null, "PrivateID":null } }