GPT
F

finetranslations

קוד פתוח

HuggingFaceFWodc-by2026-01-08

מאגר ענק למשימות תרגום ויצירת טקסט שכולל מעל טריליון רשומות במאות שפות ואלפביתים שונים. מתאים למי שבונה מודלי שפה רב לשוניים וזקוק לכיסוי נרחב של שפות נדירות לצד שפות מרכזיות.

  • 25,306הורדות בחודש
  • 302לייקים

מה זה

המאגר כולל מעל טריליון רשומות ומיועד למשימות של תרגום מכונה ויצירת טקסט חופשי. המבנה הפנימי מחולק לתצורות לפי שפה ואלפבית, כאשר כל קבוצת קבצים יושבת תחת תיקייה ייעודית שמזהה את השפה ואת הכתב שלה, כמו עברית, ערבית או שפות באלפבית קירילי ולטיני. הנתונים מאוחסנים בפורמט פרקט וכוללים אלפי קבצים נפרדים שמאפשרים טעינה ממוקדת של שפה ספציפית בלי להוריד את כל המאגר.

כרטיס הדאטהסט לא מפרט מה מקור הטקסטים המקורי, איך בדיוק אספו אותם מהרשת או ממאגרים קיימים, ואילו שלבי סינון וניקוי בוצעו עליהם. אין בתיעוד חלוקה מובנית לסט אימון, ולידציה או בדיקה, ולכן מי שמשתמש בחומר נדרש לבצע פיצול עצמאי. הנתונים מציגים מגוון עצום שנע בין שפות מדוברות מאוד כמו ספרדית, גרמנית ויפנית, ועד לדיאלקטים מקומיים ושפות עתיקות יותר.

מתאים ל

  • אימון מודלי תרגום

    משמש כבסיס רחב היקף לאימון מודלים שמתרגמים בין שפות נפוצות לשפות דלות משאבים.

  • הרחבת מודלי שפה לעברית

    אימון מקדים או התאמה של מודלי שפה גנרטיביים על נתוני עברית מתוך התצורה הייעודית.

  • מחקר בלשני חישובי

    ניתוח והשוואה של מאפייני שפה ואלפביתים שונים על פני אלפי חלוקות טקסט.

איפה זה נופל

הבעיה המרכזית במאגר היא חוסר תיעוד מוחלט לגבי אופן איסוף הנתונים, בקרת האיכות והסינון של רעש או מידע פוגעני. כרטיס המאגר לא מדווח על תאריכי הדגימה של הטקסטים, ולכן אי אפשר לדעת מראש מה מידת העדכניות שלהם. לפני שמשלבים נתונים אלה באימון מודל, חובה לדגום את הטקסטים בשפת היעד ולבדוק אם קיימים תרגומי מכונה ירודים, הזיות או כפילויות שעלולות לפגוע בביצועים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון odc-by מאפשר שימוש מסחרי מלא. התנאי המחייב היחיד הוא מתן ייחוס מתאים למפרסמי המאגר. אין דרישה לשתף את המודל המאומן בקוד פתוח.

האם המאגר כולל טקסטים בעברית?

כן, המאגר מכיל תצורות נפרדות לכתב עברי תחת heb_Hebr וכן תצורה לעברית מקראית תחת hbo_Hebr. הנתונים מאורגנים בקובצי פרקט נפרדים שניתן למשוך ישירות בלי להוריד שפות אחרות.

האם צריך להוריד את כל טריליון הרשומות כדי לעבוד עם המאגר?

ממש לא, וגם לא מומלץ לנסות לעשות זאת ללא מערך אחסון ייעודי. המאגר מחולק לתצורות לפי שפה וכתב, כך שניתן לטעון נקודתית רק את השפה הרלוונטית לפרויקט.

מאיזה מקורות נאספו הטקסטים שבפנים?

כרטיס המאגר אינו מספק מידע על מקורות הנתונים או על תהליך האיסוף והניקוי. מסיבה זו מומלץ לבצע בדיקת איכות ידנית על מדגם נתונים לפני שמתחילים באימון רחב היקף.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס באמצעות ציון המזהה HuggingFaceFW/finetranslations. אין צורך באישור גישה מוקדם או בהרשמה מיוחדת. בגלל שמדובר ביותר משבעת אלפים קבצים ומעל טריליון רשומות, מומלץ לא לטעון את התצורה הכוללת all אלא לבחור תצורה של צמד שפה וכתב ספציפיים, או לעבוד בהזרמה כדי למנוע קריסה של זיכרון העבודה והדיסק המקומי.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/finetranslations")

הרישיון

המאגר מופץ תחת רישיון odc-by, רישיון פתוח שמתיר שימוש מסחרי ומחקר. התנאי העיקרי הוא מתן קרדיט וייחוס מתאים ליוצרי המאגר בכל הפצה של הנתונים או בתוצרים שמבוססים עליהם ישירות. הרישיון אינו דורש שיתוף תחת אותו רישיון, כך שמודל שאומן על החומר אינו מחויב להיפתח לציבור באותם תנאים.

הרישיון המלא ב־Hugging Face ↗