GPT
M

mmarco

קוד פתוח

unicamp-dlרישיון לא דווח2022-03-02

גרסה מתורגמת של מאגר דירוג הפסקאות המוכר של מיקרוסופט לארבע עשרה שפות. המאגר מאפשר לאמן מודלים של אחזור מידע וחיפוש סמנטי גם מחוץ לאנגלית.

  • 4,477הורדות בחודש
  • 97לייקים

מה זה

המאגר מבוסס במקור על שאלות ופסקאות מתוך מנוע החיפוש בינג שנאספו במקור עבור פרויקט אם אס מרקו באנגלית. החוקרים מברזיל לקחו את הטקסטים הללו ותרגמו אותם לשפות שונות, כולל גרסאות תרגום מבוססות גוגל שמופיעות בנתיבי הקבצים. המבנה מחולק לשלושה רכיבים עיקריים שניתן לטעון בנפרד לפי השפה המבוקשת.

הרכיב הראשון כולל שלשות אימון שמכילות שאילתה, פסקה חיובית שמתאימה לה ופסקה שלילית שאינה רלוונטית. הרכיב השני מורכב מאוספי שאילתות מתורגמות עם מזהה מספרי וטקסט, והרכיב השלישי מכיל את אוספי הפסקאות המלאים בכל שפה. בסך הכל נכללות כאן 14 שפות, בהן אנגלית, סינית, צרפתית, גרמנית, ערבית, יפנית והולנדית.

מתאים ל

  • אימון מודלי דירוג רב לשוניים

    שימוש בשלשות האימון כדי ללמד מודל לדרג פסקאות רלוונטיות לפי שאילתות בשפות כמו ערבית, ספרדית או רוסית.

  • בניית אינדקס חיפוש סמנטי

    אחזור והטמעה של מיליוני פסקאות מתוך קובצי האוסף כדי לבדוק ביצועים של מנועי חיפוש וקטוריים.

  • הערכת ביצועי מודלי אחזור

    בדיקת איכות התוצאות של מודלי אחזור מידע על בסיס השאילתות המתורגמות והתאמתן לפסקאות.

איפה זה נופל

הטקסטים בכל השפות שאינן אנגלית הם תוצר של תרגום מכונה, על כל המגבלות והטעויות שתרגום כזה מייצר בהבנת הקשר וסלנג. בנוסף, עברית לא נתמכת כאן בכלל מתוך 14 השפות הזמינות. המאגר מתאים למי שבונה מנועי חיפוש לשפות ספציפיות כמו ערבית או רוסית, אבל הוא יורש את כל הבעיות המקוריות של אם אס מרקו ומכניס שגיאות תרגום שמחייבות בדיקה ידנית לפני שמשלבים אותו במערכת קריטית.

שאלות
נפוצות

האם יש תמיכה בעברית בדאטהסט הזה?

לא, המאגר לא כולל עברית. הוא תומך ב־14 שפות בלבד, ביניהן אנגלית, ערבית, רוסית, ספרדית, סינית ועוד כמה שפות אירופיות ואסיאתיות. מי שמחפש נתונים בעברית יצטרך לתרגם את המקור בעצמו.

האם מותר להשתמש במאגר למוצר מסחרי?

במטא דאטה של הדף מופיע שהרישיון לא דווח, אבל בגוף הכרטיס מצוין רישיון אפאצ'י שתיים אפס. רישיון אפאצ'י מאפשר שימוש מסחרי חופשי בכפוף למתן קרדיט ושמירת תנאי הרישיון, אך יש לשים לב גם למגבלות המקוריות של אם אס מרקו עצמו.

מה ההבדל בין המאגר הזה לגרסה המקורית של מיקרוסופט?

הגרסה המקורית של מיקרוסופט נבנתה באנגלית בלבד מתוך שאילתות חיפוש אמיתיות בבינג. המאגר הנוכחי לקח את אותם הטקסטים בדיוק ותרגם אותם באמצעות מכונה לשפות נוספות, כך שניתן לאמן עליהם מודלים רב לשוניים.

מה המבנה של קובצי האימון בתוך המאגר?

שלשות האימון מגיעות במבנה שמכיל שאילתה, תוכן של פסקה שמתאימה לה ותוכן של פסקה שאינה קשורה. המבנה הזה נועד לאימון ישיר של מודלים מבוססי למידה עמוקה שמבצעים דירוג והשוואה בין תוצאות חיפוש.

איך טוענים

טוענים את המאגר דרך ספריית הדאטהסטס של האגינג פייס בעזרת פקודת הטעינה הרגילה, ומציינים את השפה או הקונפיגורציה שרוצים. אין צורך באישור גישה מקדים או בהרשמה מיוחדת. בטעינת שלשות האימון מקבלים שדות של שאילתה, פסקה חיובית ופסקה שלילית, ואילו בטעינת אוספי הפסקאות והשאילתות המבנה פשוט יותר וכולל רק מזהה וטקסט. המאגר מורכב ממעל מאה קבצים, בעיקר קובצי טי אס וי מחולקים לפי שפות ומקורות.

from datasets import load_dataset

ds = load_dataset("unicamp-dl/mmarco")

הרישיון

במטא דאטה של העמוד מצוין שלא דווח רישיון, אבל בתוך הטקסט של הכרטיס והקבצים עצמם נכתב שהפרויקט משוחרר תחת אפאצ'י שתיים אפס. אם מסתמכים על טקסט הכרטיס, הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והקרדיט למפתחים המקוריים.

הרישיון המלא ב־Hugging Face ↗