# Model Documentation Evaluation Template # Metadata model_name: "Bielik v3 11B Instruct" model_link: "https://huggingface.co/speakleash/Bielik-11B-v3.0-Instruct" organization: "SpeakLeash" org_link: "https://speakleash.org/" evaluation_date: "2026-01-12" public_summary_link: "https://bielik.ai/downloads/Bielik%2011B%20v3%20EU%20Public%20Summary.pdf" public_summary_date: "2026-01-01" public_summary_location: "https://huggingface.co/speakleash/Bielik-11B-v3.0-Instruct" model_publication_date: "2025-12-31" category: "Fine-tuned model" # New model, fine-tuned model archive_file_name: "Bielik_3_2026_01_12.pdf" # Requirement assessments # Each requirement should be assessed once with a score from 0-10 # Leave blank for N/A, and assign a max score of 0 S1: # Document-level requirements D1: # Clarity score: 9 max_score: 11 notes: "" D2: # Completeness score: 4 max_score: 4 notes: "" D3: # Consistency score: 7 max_score: 7 notes: "" D4: # Correctness score: 4 max_score: 5 notes: "" D5: # Accessibility score: 10 max_score: 10 notes: "" D6: # Comprehension score: 6 max_score: 9 notes: "" S2: # General information D1: # Clarity score: 35.5 max_score: 45 notes: "" D2: # Completeness score: 71 max_score: 82 notes: "" D3: # Consistency score: 8 max_score: 8 notes: "" D4: # Correctness score: 23 max_score: 23 notes: "" D5: # Accessibility score: 5 max_score: 5 notes: "" D6: # Comprehension score: 10 max_score: 11 notes: "" S3: # Public datasets D1: # Clarity score: 92 max_score: 92 notes: "" D2: # Completeness score: 104 max_score: 140 notes: "" D3: # Consistency score: 23 max_score: 23 notes: "" D4: # Correctness score: 20 max_score: 20 notes: "" D5: # Accessibility score: 20 max_score: 20 notes: "" D6: # Comprehension score: 16 max_score: 16 notes: "" S4: # Private datasets D1: # Clarity score: 0 max_score: 0 notes: "" D2: # Completeness score: 5 max_score: 5 notes: "" D3: # Consistency score: 3 max_score: 3 notes: "" D4: # Correctness score: 5 max_score: 5 notes: "" D5: # Accessibility score: 0 max_score: 0 notes: "" D6: # Comprehension score: 0 max_score: 0 notes: "" S5: # Scraped/crawled data D1: # Clarity score: 109 max_score: 119 notes: "" D2: # Completeness score: 110 max_score: 135 notes: "" D3: # Consistency score: 3 max_score: 3 notes: "" D4: # Correctness score: 88 max_score: 113 notes: "" D5: # Accessibility score: 0 max_score: 25 notes: "" D6: # Comprehension score: 53 max_score: 78 notes: "" S6: # User data D1: # Clarity score: 0 max_score: 0 notes: "" D2: # Completeness score: 8 max_score: 8 notes: "" D3: # Consistency score: 3 max_score: 3 notes: "" D4: # Correctness score: 8 max_score: 8 notes: "" D5: # Accessibility score: 0 max_score: 0 notes: "" D6: # Comprehension score: 0 max_score: 0 notes: "" S7: # Synthetic & other D1: # Clarity score: 24 max_score: 24 notes: "" D2: # Completeness score: 18 max_score: 18 notes: "" D3: # Consistency score: 6 max_score: 6 notes: "" D4: # Correctness score: 18 max_score: 18 notes: "" D5: # Accessibility score: 0 max_score: 0 notes: "" D6: # Comprehension score: 12 max_score: 12 notes: "" S8: # Data processing D1: # Clarity score: 18 max_score: 19 notes: "" D2: # Completeness score: 19 max_score: 19 notes: "" D3: # Consistency score: 3 max_score: 3 notes: "" D4: # Correctness score: 37 max_score: 37 notes: "" D5: # Accessibility score: 0 max_score: 15 notes: "" D6: # Comprehension score: 60 max_score: 69 notes: "" general_notes: "The open collaboration project SpeakLeash publishes a public summary for its Bielik v3 11B Instruct model on its website and also links it in its model card. The public summary follows the structure of the template, and describes Bielik as a fine-tuned version of Mistral. Of note, Bielik utilised the optional additional comments field in Section 1.3 to describe the purposes, regional, and linguistic characteristics of the dataset used as based on Polish and EU legal administrative domains and the inclusion of Silesian and Kashubian language Wikipedia pages. For their list of public data sources, however, the description referenced external documents ('preprints') which resulted in a deduction of points as relevant information was not provided in the document. We assessed its score to be 88.02% with grade B+ for transparency, and 71.11% with grade C+ for usefulness."