GPT
M

massive

קוד פתוח

AmazonSciencecc-by-4.02022-04-27

  • natural-language-understanding

מאגר מקבילי של פקודות קוליות מתורגמות ל־52 שפות שונות, כולל עברית. הוא נועד לאימון מודלים להבנת כוונות ושליפת ישויות בעוזרים קוליים.

  • 9,049הורדות בחודש
  • 97לייקים

מה זה

הנתונים מבוססים על SLURP, מאגר של אינטראקציות עם עוזרים קוליים באנגלית אמריקאית. החוקרים לקחו את המשפטים המקוריים ותרגמו אותם בעזרת עובדי אמזון מכניקל טורק ל־51 שפות נוספות, תוך לוקליזציה של שמות וביטויים מקומיים.

כל שורה כוללת את הטקסט הגולמי, תיוג תחום, כוונה ספציפית מתוך 60 אפשרויות, וסגמנטציה של ישויות בתוך המשפט מתוך 55 סוגים מוגדרים. יש גם מטה-דאטה שמציין אם ישות תורגמה, הוחלפה בישות מקומית או נשארה באנגלית.

המבנה זהה בכל השפות. יש חלוקה קבועה מראש לסט אימון עם 11,514 דוגמאות, סט ולידציה עם 2,033 דוגמאות וסט בדיקה עם 2,974 דוגמאות בכל שפה.

מתאים ל

  • זיהוי כוונות

    אימון מסווגים להבנת הבקשה של המשתמש מתוך 60 כוונות מוגדרות מראש.

  • חילוץ ישויות

    שליפת פרמטרים כמו שעות, מקומות ושמות מתוך פקודות טקסט ב־52 שפות.

  • הערכת מודלים רב-לשוניים

    בדיקת ביצועים השוואתית בין שפות שונות על אותו סט מבחן בדיוק.

איפה זה נופל

כל המשפטים נולדו מתרגום של פקודות שנכתבו במקור באנגלית אמריקאית, ולכן התחביר לעיתים מתורגם מדי ולא נשמע כמו דיבור יומיומי טבעי בעברית. המאגר מוגבל לפקודות קצרות וחד-שלביות של עוזר קולי ב־18 עולמות תוכן בלבד, כך שהוא לא יעזור לשיחות מורכבות או לצ'אטבוטים כלליים.

שאלות
נפוצות

האם יש במאגר עברית?

כן, המאגר כולל עברית תחת הסימול he-IL עם 16,521 משפטים בסך הכל. כל המשפטים מקבילים לחלוטין לגרסה האנגלית.

האם מותר להשתמש בזה למוצר מסחרי?

כן, רישיון CC BY 4.0 מתיר שימוש מסחרי מלא. הדרישה היחידה היא לתת ייחוס הולם ליוצרי המאגר.

איך נאספו המשפטים?

הבסיס נלקח ממאגר SLURP באנגלית. עובדים בפלטפורמת מכניקל טורק תרגמו והתאימו את המשפטים והישויות לשפות היעד שלהם.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets על ידי ציון שם המאגר והקוד של השפה הרצויה, למשל he-IL לעברית. אין צורך באישור גישה מראש או במפתח מיוחד.

השדות העיקריים לעבודה הם utt שמכיל את הטקסט הנקי, intent שמחזיק את התווית לסיווג, ו־annot_utt שמכיל את הטקסט יחד עם תיוגי הישויות במבנה סוגריים.

from datasets import load_dataset

ds = load_dataset("AmazonScience/massive")

הרישיון

הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי ומחקר. אין חובה לשתף נגזרות באותו רישיון, ומותר לאמן מודלים למוצרים מסחריים כל עוד נותנים קרדיט מתאים לאמזון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗