GPT
A

amazon_massive_intent

קוד פתוח

mtebapache-2.02022-05-15

  • mteb
  • text

פקודות קוליות קצרות מסווגות לכוונות משתמש בעשרות שפות שונות. מי שבונה סייען קולי או מנוע ניתוב טקסט מקבל כאן מבחן השוואתי מוכן למודלי שיבוץ.

  • 48,370הורדות בחודש
  • 27לייקים

מה זה

הרשומות מכילות משפטים קצרים מתחום הדיבור היומיומי, דוגמת בקשות להפעלת מוזיקה, בירור מזג אוויר, כיבוי אורות וקביעת פגישות ביומן. לכל רשומה מוצמדת תווית כוונה מתוך עשרות תוויות מוגדרות מראש, כמו שאלות על לוח שנה או שליטה במכשירים חכמים. הנתונים מתועדים כחלק ממחקר רחב היקף על הבנת שפה טבעית בקרב 51 שפות.

המבנה מחולק לקובצי הערכה ובדיקה לפי שפות שונות, כאשר המאגר המקורי מבוסס על תרגום והתאמה של ביטויי סייען וירטואלי. בקובצי המאגר הנוכחיים שמורים נתוני מבחן ואימות, כשהטקסטים קצרים במיוחד ועומדים על ממוצע של כארבעים ושלושה תווים למשפט.

מתאים ל

  • בדיקת מודלי שיבוץ

    הרצת סיווג כוונות דרך ספריית הבנצ'מרק כדי לבדוק דיוק של ייצוגי טקסט.

  • אימון סייען קולי רב לשוני

    זיהוי כוונות משתמש עבור פקודות IoT, בירורי מוזיקה ושליטה ביומן בשפות נתמכות.

  • מערכות ניתוב הודעות

    סיווג משפטי משתמש קצרים ישירות לקטגוריות ביצוע מוגדרות מראש.

איפה זה נופל

אם אתם מכוונים לשוק הישראלי, עברית אינה מופיעה ברשימת השפות של המאגר הזה. הנתונים מוגבלים מאוד לתחום העוזרים האישיים והבית החכם, כך שהם לא משקפים שיחות שירות ארוכות או טקסטים עסקיים מורכבים. בנוסף, קיימת חפיפה של כמה אלפי טקסטים בין סטי האימות והבדיקה לבין נתוני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל שילוב במוצרים ואימון מודלים פנימיים. חובה רק לכלול עותק של הרישיון והצהרת הייחוס המקורית.

האם הדאטהסט כולל תמיכה בעברית?

לא. רשימת השפות המדווחת כוללת שפות כמו אנגלית, גרמנית, ערבית, פרסית ודנית, אך עברית אינה נכללת בהן. לבניית מוצר מקומי תידרשו לאסוף נתונים ממקור אחר.

איזה סוג תוכן יש בטקסטים?

מדובר במשפטי דיבור קצרים מאוד שמופנים לעוזרים קוליים. הדוגמאות מתמקדות בבקשות מוזיקה, שאילתות מזג אוויר, תזכורות ופקודות למכשירים חכמים, עם ממוצע של כארבעים ושלושה תווים למשפט.

איך טוענים

טוענים את המשימה ישירות בקוד פייתון דרך חבילת mteb, בלי צורך באישור גישה ידני או בהרשמה מוקדמת. המאגר מכיל 156 קבצים דחוסים בפורמט json.gz המחולקים לפי קודי שפות, יחד עם קובצי הגדרות של הבנצ'מרק. השדות החשובים לשימוש הם טקסט הפקודה ותווית הסיווג המשויכת אליו לצורך חישוב הדיוק של מודל השיבוץ.

from datasets import load_dataset

ds = load_dataset("mteb/amazon_massive_intent")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, מחקרי ופרטי, כולל שינוי של המידע והפצה שלו. מותר לאמן עליו מודלים מסחריים, בתנאי ששומרים על תנאי הייחוס ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗