GPT
F

fineweb-edu-translated

קוד פתוח

Helsinki-NLPodc-by2025-07-24

תרגום מכונה מסיבי של טקסטים לימודיים מאנגלית ל־36 שפות שונות. מי שמאמן מודלים רב-לשוניים מקבל פה מקבילות מיושרות בהיקף ענק בלי לאסוף רשת בעצמו.

  • 83,211הורדות בחודש
  • 16לייקים

מה זה

המאגר מכיל מסמכים מתוך fineweb-edu שתורגמו מאנגלית באמצעות מודלים פתוחים של OPUS-MT ו־HPLT-MT. בגרסה הראשונה יש 36,704,000 מסמכים המקבילים למעל 28 מיליארד טוקנים באנגלית, כשהסך הכולל בכל השפות חוצה את 960 מיליארד הטוקנים. כל המסמכים המתורגמים שמורים בצורה מיושרת מול שפת המקור.

בגרסה 1.1 הוסיפו נפח משמעותי לצ'כית ולאוקראינית שהכפיל את המידע עבורן, ובפינית תרגמו את כלל 350 מיליארד הטוקנים של המקור. הקבצים מחולקים לפי תיקיות של קודי שפה, כך שכל שפה מחזיקה את קובצי הנתונים שלה בנפרד ומאפשרת שימוש ממוקד בלי לגעת בשאר.

מתאים ל

  • אימון מודלי שפה רב-לשוניים

    הרחבת יכולות יצירת טקסט והבנה ב־36 שפות אירופיות על בסיס תוכן לימודי מיושר.

  • טיוב מודלי תרגום מכונה

    שימוש במסמכים המקבילים לטובת אימון מודלים של תרגום מאנגלית לשפות יעד שונות.

  • הערכת עקביות בין שפות

    בדיקת מודלים על אותם טקסטים בדיוק במגוון שפות כדי לבחון ביצועים השוואתיים.

איפה זה נופל

כל הטקסטים כאן הם תוצר של תרגום מכונה אוטומטי ולא נבדקו בידי אדם. מודלי התרגום של OPUS-MT ו־HPLT-MT כוללים טעויות תרגום, עיוותי משמעות והזיות שמועתקות ישירות אל תוך המידע. בנוסף, עברית בכלל לא קיימת ברשימת השפות הנתמכות, כך שהמאגר אינו רלוונטי לאימון מקומי בארץ.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, עברית לא נכללת ב־36 השפות של המאגר. הרשימה מתמקדת בעיקר בשפות אירופיות כמו גרמנית, צרפתית, ספרדית ופינית. לחוקרים שמחפשים דאטה בעברית המאגר הזה אינו מביא תועלת.

האם מותר להשתמש במידע לאימון מודל מסחרי?

כן, רישיון odc-by מתיר שימוש מסחרי מלא בנתונים. החובה המרכזית היא מתן קרדיט ברור ליוצרי המאגר מ־Helsinki-NLP וציטוט המאמר שלהם. אין הגבלה על סגירת הקוד או המשקולות של המודל שתאמנו.

באיזה אופן הטקסטים תורגמו?

הטקסטים נוצרו באמצעות מודלי תרגום נוירוניים של OPUS-MT ו־HPLT-MT שהורצו על גבי מחשב-על. התהליך היה אוטומטי לחלוטין וללא עריכה אנושית. כתוצאה מכך יש לצפות לשגיאות תחביר ואי-דיוקים שמאפיינים תרגום מכונה.

איך מורידים רק שפה מסוימת מתוך המאגר?

המאגר מחולק ל־2,794 קובצי Parquet בתוך תיקיות ייעודיות לכל שפה. אפשר להגדיר בטעינה את הנתיב המדויק לשפה המבוקשת, למשל תיקיית ces עבור צ'כית. גישה זו חוסכת הורדה של מאות גיגה-בייטים של שפות שאינן נחוצות לכם.

איך טוענים

טוענים ישירות דרך ספריית הנתונים באמצעות המזהה של המאגר, ללא צורך באישור גישה או הרשמה מיוחדת. הנתונים מאורגנים ב־2,794 קובצי Parquet המחולקים לפי שפות, למשל bos/fineweb-edu_350BT_00000.parquet. אם אתם עובדים על שפה אחת, מומלץ להוריד רק את התיקייה הספציפית שלה במקום למשוך את כל המאגר שדורש נפח אחסון עצום.

from datasets import load_dataset

ds = load_dataset("Helsinki-NLP/fineweb-edu-translated")

הרישיון

המאגר מופץ תחת רישיון odc-by. הרישיון מאפשר שימוש מסחרי, שינוי והפצה מחדש, בתנאי שאתם מעניקים ייחוס הולם למחברים ומצטטים את המאמר האקדמי שלהם. אין דרישה לשתף תוצרים באותו הרישיון, ולכן אפשר לאמן עליו מודלים מסחריים סגורים.

הרישיון המלא ב־Hugging Face ↗