GPT
F

flores_101

קוד פתוח

gsarticc-by-sa-4.02022-03-02

  • conditional-text-generation

המאגר מרכז 3001 משפטים מוויקיפדיה באנגלית שתורגמו ל־101 שפות בידי מתרגמים מקצועיים. הוא מיועד למדידה והשוואה מדויקת של מודלי תרגום מכונה, בעיקר בשפות עם מעט משאבים.

  • 10,572הורדות בחודש
  • 33לייקים

מה זה

הנתונים כוללים משפטים מקבילים שנלקחו מתוך ויקיפדיה באנגלית במגוון נושאים ותחומים, אשר תורגמו ל־101 שפות שונות בתהליך מבוקר על ידי מתרגמים אנושיים מקצועיים. כל המשפטים מיושרים ומקבילים לחלוטין בין כל השפות, כך שניתן לבחון תרגום ישיר בין כל צמד שפות שקיים במאגר. הטקסט מוגש בצורתו המקורית ללא עיבוד מקדים או טוקניזציה.

כל רשומה במאגר מחזיקה מזהה רץ שמתחיל מ־1, את המשפט המתורגם בשפה הנבחרת, כתובת המקור של המאמר באנגלית, וכן סיווג של התחום והנושא. בנוסף נשמר מידע על נוכחות קישורים חיצוניים או תמונות במאמר המקורי. המאגר הגלוי מחולק לשני פיצולים בלבד, כאשר פיצול dev מכיל 997 משפטים, ופיצול devtest מכיל 1012 משפטים עבור כל קונפיגורציה.

מתאים ל

  • הערכת מודלי תרגום

    בדיקת איכות התרגום של מודלים בין עשרות שפות שונות על גבי משפטים מקבילים לחלוטין.

  • בנצ'מרק לשפות דלות משאב

    מדידת ביצועים מדויקת בשפות שלא קיימים עבורן סטים גדולים ואמינים של מבחני איכות.

  • בדיקת תרגום רב לשוני ישיר

    השוואת תרגום משפה זרה אחת לאחרת ללא מעבר ותיווך דרך השפה האנגלית.

איפה זה נופל

המאגר מיועד להערכה ומבחן בלבד ולא לאימון מודלים, בגלל כמות דגימות קטנה מאוד של כאלפיים משפטים גלויים לכל שפה. מקור המשפטים הוא ויקיפדיה באנגלית, מה שמייצר הטיה ברורה לסגנון אנציקלופדי ותכנים מערביים, גם כשהם מתורגמים לשפות אחרות. לא הייתי בונה על הנתונים האלה כדי להעריך שיחות יומיומיות, סלנג או טקסטים עסקיים שרחוקים מסגנון הכתיבה של ויקיפדיה.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

הרישיון cc-by-sa-4.0 מאפשר שימוש מסחרי עקרוני, אך דורש מתן קרדיט מלא ושיתוף זהה של כל תוצר נגזר. המשמעות היא ששילוב הנתונים ישירות במוצר או שינוי שלהם מחייב שחרור התוצאה באותו רישיון פתוח. לכן, שימוש בו כסט בדיקה חיצוני ללא הפצה של הנתונים עצמם הוא הדרך הבטוחה לעבודה.

האם המאגר מתאים לאימון של מודל שפה חדש?

המאגר הזה אינו מיועד לאימון מודלים מאפס וגם לא לכוונן עדין רחב. יש בו רק כאלפיים משפטים זמינים לכל שפה בפיצולים הפתוחים, כמות קטנה מדי לכל תהליך למידה משמעותי. המטרה המוגדרת שלו היא לשמש מבחן השוואתי מדויק עבור מודלים שכבר אומנו.

איך נאספו ותורגמו המשפטים במאגר?

היוצרים דגמו 3001 משפטים מתוך ויקיפדיה באנגלית במגוון נושאים ותחומים שונים. משפטים אלה הועברו למתרגמים אנושיים מקצועיים שתירגמו אותם באופן ישיר ומבוקר ל־101 שפות. התהליך כלל בקרת איכות קפדנית כדי לוודא דיוק והתאמה מלאה בין כל השפות.

כמה שוקל המאגר ומה הדרישות הטכניות להרצה?

המאגר קל מאוד וכולל רק ארבעה קבצים במאגר המרכזי עם סקריפטים ומידע טקסטואלי. טעינת שפה בודדת אורכת שניות ספורות ודורשת זיכרון עבודה מינימלי בכל מחשב סטנדרטי. גם טעינה של כל 101 השפות יחד באמצעות ההגדרה all אינה יוצרת עומס כבד על החומרה.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות הקריאה הרגילה עם המזהה של המאגר, ללא צורך באישור גישה מיוחד. אפשר למשוך שפה בודדת לפי קוד ISO שלה כמו rus או eng, או להשתמש בהגדרה all כדי להוריד את כל השפות במקביל. השדות העיקריים שמעניינים אתכם הם sentence שמכיל את הטקסט, ו־id שמאפשר להצליב וליישר את המשפט המקביל בין שפות שונות.

from datasets import load_dataset

ds = load_dataset("gsarti/flores_101")

הרישיון

הנתונים מופצים ברישיון cc-by-sa-4.0. הרישיון מאפשר שימוש מסחרי, אך מחייב מתן קרדיט ליוצרים ושיתוף של כל יצירה נגזרת תחת אותו רישיון בדיוק. אם תאמנו מודל ישירות על הנתונים הללו או תפיצו גרסה משופרת שלהם, דרישת השיתוף הזהה עלולה לחול על התוצרים שלכם, ולכן לרוב שומרים את המאגר להרצת בדיקות ביצועים בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗