GPT
N

nllb

קוד פתוח

allenaiרישיון לא דווח2022-08-14

המאגר כולל זוגות משפטים מקבילים לתרגום מכונה מבוסס כרייה ברוחב של מעל אלף שילובים. זה פתרון למי שבונה מודלים לזוגות שפות נדירות שלא עוברות דרך אנגלית.

  • 2,365הורדות בחודש
  • 110לייקים

מה זה

הנתונים נבנו על בסיס מטא דאטה שפרסמה מטא עבור פרויקט NLLB, ומכילים משפטים מקבילים עבור 148 זוגות מול אנגלית ועוד 1,465 זוגות ישירים בין שפות אחרות. הכרייה התבצעה באמצעות ספריית stopes ומודלי קידוד של LASER3, כאשר המקורות העיקריים לטקסט החד לשוני כוללים סריקות Common Crawl ומאגרים קהילתיים כמו Leipzig, IndicNLP ופרויקטים נוספים.

כל רשומה מחזיקה צמד משפטים מתורגם, ציון התאמה של LASER, ציוני סיווג זיהוי שפה לכל צד, ואת מקור המשפט כולל כתובת רשת מלאה אם הוא נשלף מסריקת אינטרנט. השורות בכל קובץ כבר ממוינות מראש לפי ציון LASER בסדר יורד, כך שהתרגומים האיכותיים יותר מופיעים בהתחלה.

הסינון הראשוני התבסס על זיהוי שפה, הסרת אימוג'ים, ובחלק מהשפות העשירות במשאבים גם סינון באמצעות מודל שפה. אין במאגר חלוקה מובנית לסט אימון, פיתוח או בדיקה.

מתאים ל

  • אימון תרגום לשפות נדירות

    אימון מודלי שפה ותרגום מכונה על 1,465 זוגות ישירים ללא תיווך של אנגלית.

  • סינון קורפוס לפי איכות

    בניית תת מאגר נקי על ידי חיתוך רשומות לפי ציוני laser_score וזיהוי שפה.

  • כריית ידע רב לשוני

    מחקר על יישור משפטים בין שפות שונות שנסרקו ממאגרי רשת מגוונים.

איפה זה נופל

הנתונים מגיעים מכרייה אוטומטית ולכן סובלים מרעש ניכר, טעויות יישור והטיות שקיימות בסריקות רשת. הכרטיס מציין במפורש שהמאגר כולל בתוכו חלקי סטים של פיתוח ובדיקה ממאגרים חיצוניים כמו xlsum, וסריקות הרשת יצרו חפיפות אקראיות עם סטים מקובלים. מסיבה זו המפרסמים ממליצים להשתמש בנתונים רק לאימון, ולא להעריך עליהם ביצועים בשום אופן. להערכה תצטרכו להביא סט נפרד ונקי כמו Flores-200.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון בדף המאגר מוגדר כלא דווח. בהיעדר תנאי שימוש ברורים לא כדאי להכניס את הנתונים לצנרת אימון של מוצר מסחרי בלי בדיקה משפטית של מקורות המידע של מטא.

כמה מקום צריך בשביל להוריד את כל המאגר?

המאגר המלא שוקל כ 450GB ומורכב מקבצי טקסט דחוסים. אם אתם צריכים רק שילוב שפות מסוים, אין חובה להוריד את כולו ואפשר לטעון רק את הצמד הספציפי.

האם אפשר לבדוק ביצועי מודל על הנתונים האלה?

לא, המפרסמים ממליצים להשתמש בו לאימון בלבד. התהליך כולל רעש כרייה טבעי וזיהום אפשרי של סטי מבחן מתוך סריקות הרשת, כך שלהערכה עדיף לקחת מאגר כמו Flores-200.

איך המשפטים נאספו ואיך יודעים אם התרגום אמין?

הטקסטים נאספו ממאגרים חד לשוניים ומסריקות Common Crawl, ועברו כרייה וצימוד באמצעות קידודי LASER3 וספריית stopes. לכל זוג משפטים מוצמד ציון התאמה וציון זיהוי שפה, כך שאפשר לסנן לבד משפטים באיכות נמוכה.

איך טוענים

טעינה ממוקדת של צמד שפות נעשית דרך ספריית datasets באמצעות העברת המזהה allenai/nllb ושם הצמד הספציפי, כמו ace_Latn-ban_Latn. המאגר המלא שוקל כ 450GB ומחולק ל 1,616 קבצים דחוסים בפורמט טקסט מופרד בטאבים, כך שאפשר גם לשבט אותו ישירות עם Git LFS. אין צורך לבקש אישור גישה מיוחד כדי להוריד. השדות שתרצו לסנן לפיהם הם laser_score וציוני ה lid של שני המשפטים כדי לחתוך רעשי כרייה חלשים.

from datasets import load_dataset

ds = load_dataset("allenai/nllb")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. המשמעות המשפטית היא שאין היתר שימוש מפורש, לא לצרכים מסחריים ולא למחקר, ומבחינת דיני זכויות יוצרים השימוש בו מהווה סיכון לכל מוצר שתבנו. אם אתם מתכננים להפיץ מודל או שירות שמסתמך עליו, תצטרכו לבדוק את תנאי המקור של מטא ושל המאגרים הבסיסיים לפני שאתם נוגעים בו.

הרישיון המלא ב־Hugging Face ↗