GPT
F

finetranslations-edu

קוד פתוח

HuggingFaceFWodc-by2026-01-08

המאגר מרכז מעל טריליון טוקנים של טקסט מקבילי מאנגלית לכ־500 שפות, שנוצרו באמצעות תרגום מכונה של מקורות רשת. גרסת ה־Edu מציעה סינון ממוקד של עשרת האחוזים בעלי הערך הלימודי הגבוה ביותר.

  • 3,445הורדות בחודש
  • 30לייקים

מה זה

הנתונים נשענים על FineWeb2, שמקורו בדפי אינטרנט של CommonCrawl בין השנים 2013 ל־2024. היוצרים סיננו שפות שהורכבו ברובן מטקסטים דתיים או ויקיפדיה, והגבילו כל שפה לתקרה של עד 50 מיליארד טוקנים תוך שימוש במסווגי איכות או דגימה אקראית. התרגום לאנגלית בוצע באמצעות המודל Gemma 3 27B במקטעים של עד 512 טוקנים, תחת הנחיות קשיחות לשימור מבנה השורות ומניעת תוכן למבוגרים והימורים.

גרסת ה־Edu כוללת פיצול יחיד ללא חלוקה מראש לשפות שונות, ומרכזת רק את הטקסטים שקיבלו את הציון הגבוה ביותר במדרג של מסווג לימודי ייעודי שאומן על הפלטים המתורגמים. כל רשומה כוללת את הטקסט המקורי המלא, הטקסט המתורגם לאנגלית, חלוקה תואמת למקטעים, מזהי שפה, כתובת אתר המקור, וציוני איכות וערך לימודי.

מתאים ל

  • אימון מודלי תרגום

    כוונון עדין של מודלים לתרגום מאנגלית ליותר מ־500 שפות יעד.

  • הרחבת אימון מודל אנגלי

    אימון מקדים של מודלי שפה באנגלית על תוכן עשיר תרבותית שעבר סינון לימודי.

  • הערכת תרגום חישובי

    בדיקת איכות של מודלים רב-לשוניים מול מקטעי טקסט מקביליים במגוון שפות.

איפה זה נופל

התרגומים כולם הם פלט סינתטי של מודל יחיד, מה שמכניס שגיאות תרגום אופייניות, ניסוחים מלאכותיים והזיות אפשריות של Gemma 3 27B לתוך כל הדאטהסט. בשפות דלות משאבים הצוות נתקל במקור ברמות גבוהות של תוכן פוגעני וספאם, וחרף הסינון הראשוני חלק מזה עלול לחלחל. בנוסף, כל השפות מאוחדות לתת-מאגר בודד, כך שנדרש סינון עצמאי לפי og_language כדי לעבוד על שפה מסוימת, והטקסטים נחתכים במקרים שבהם המודל הפר את כללי העימוד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי מלא, כולל אימון מודלים סגורים. הדרישה העיקרית היא מתן קרדיט מתאים ליוצרי המאגר במסמכי המודל או במערכת.

האם המאגר כולל עברית?

כרטיס המאגר מציין רק רשימה מדגמית קצרה של קודי שפות שאינה כוללת עברית, אך המקור מתבסס על כ־500 שפות מתוך FineWeb2. כדי לבדוק נוכחות של עברית יש לסנן את הנתונים ישירות לפי קוד השפה המתאים בשדה og_language.

איך נאסף המידע?

הטקסטים המקוריים נשלפו מדפי אינטרנט של CommonCrawl במסגרת פרויקט FineWeb2. לאחר מכן הם תורגמו לאנגלית על ידי המודל Gemma 3 27B, ולבסוף סוננו כך שנשמרו רק עשרת האחוזים המובילים לפי מסווג איכות לימודי.

מה ההבדל בין גרסה זו לגרסת הבסיס של FineTranslations?

גרסת הבסיס כוללת את כל הטקסטים המתורגמים ומחולקת לתת-מאגרים לפי שפות. גרסת ה־Edu כוללת רק עשרה אחוזים מהחומר שקיבלו את הציונים הגבוהים ביותר במסווג הלימודי, ומגיעה בתת-מאגר יחיד המאחד את כל השפות יחד.

איך טוענים

טוענים את המאגר באמצעות ספריית datasets עם ציון שם הפיצול כ־train ומצב תזרים פעיל, או מורידים ישירות דרך huggingface_hub באמצעות snapshot_download של תיקיית data. המאגר מורכב מ־668 קובצי Parquet, ולא נדרש אישור גישה מוקדם כדי להוריד אותם. שדות המפתח לעבודה הם og_language לזיהוי שפת המקור, וצמדי המקטעים og_chunks ו־translated_chunks ששומרים על התאמה מדויקת ביניהם. אם השדה early_stop מסומן כחיובי, חלק מהמקטעים נשמטו בגלל בעיות עימוד, והטקסט המקורי המלא לא יתאים במדויק לתרגום.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/finetranslations-edu")

הרישיון

המאגר מופץ תחת רישיון ODC-By 1.0. השימוש מותר למטרות מחקר ומסחר, בתנאי שניתן ייחוס הולם למפרסמים כפי שמוגדר ברישיון. הרישיון אינו כופה שיתוף זהה על בסיסי נתונים נגזרים או מודלים שאומנו עליו, כך שניתן לשלב את הנתונים בתהליכי אימון של מודלים קנייניים.

הרישיון המלא ב־Hugging Face ↗