GPT
S

SIFT-50M

קוד פתוח

amazon-agicdla-sharing-1.02025-03-24

  • speech
  • speech-llm
  • spoken-language-understanding
  • controllable-speech-synthesis
  • instruction-finetuning

מאגר ענק של 50 מיליון דוגמאות להוראות דיבור וטקסט בחמש שפות. הוא נותן בסיס רחב למי שמאמן מודלי שפה לעיבוד, הבנה ויצירה של אודיו.

  • 1,824הורדות בחודש
  • 38לייקים

מה זה

המאגר מכיל זוגות של שאלות ותשובות שנבנו על בסיס 14,000 שעות שמע ממאגרים ציבוריים מוכרים כמו MLS, Common Voice 15 ו־VCTK. כל רשומה מעוצבת בפורמט Messages של שתי פניות בלבד, אחת של המשתמש ואחת של העוזר, כאשר קלט המשתמש מפנה למזהה האודיו והוראת הטקסט, והתשובה מכילה את הניתוח המבוקש. יצירת הדוגמאות התבססה על מודלי שפה ומודלי מומחה לניתוח אקוסטי ותוכני.

הנתונים מחולקים למספר מחיצות עבודה ראשיות: train לאימון, dev לפיתוח, ו־EvalSIFT לבנצ'מרק והערכה. בנוסף קיימת חלוקה לנושאים כמו שאלות סגורות ברמה האקוסטית, שאלות תוכן, השוואות, שאלות פתוחות, ויצירת דיבור נשלטת. יש גם תיקיית research שמכילה דוגמאות שסוננו החוצה בזמן בקרת האיכות עקב פגיעה בביצועים, בעיקר משימות יישור מילים מרובות תורות פנייה.

מתאים ל

  • אימון הבנת דיבור

    כוונון מודלי שפה להבנת מאפיינים אקוסטיים של דיבור כמו קצב, בהירות ואיכות הקלטה.

  • יצירת דיבור מבוקרת

    בניית מודלים ליצירת אודיו מטקסט לפי הוראות סגנון מוגדרות מראש.

  • הערכת ביצועי מודלים

    מבחני ביצועים למודלי שמע בעזרת סט ההערכה הייעודי EvalSIFT.

איפה זה נופל

אם אתם בונים מוצר בעברית, המאגר הזה פשוט לא בשבילכם. הוא תומך באנגלית, גרמנית, צרפתית, איטלקית וספרדית בלבד, כאשר אנגלית מהווה את הרוב המוחלט של הדוגמאות. מעבר לפער השפות, אין פה קובצי שמע בפועל אלא רק טקסט ומטא-דאטה, מה שדורש תהליך הכנה ארוך ומורכב של הורדת מאגרי מקור חיצוניים וסנכרון הנתיבים.

שאלות
נפוצות

האם המאגר כולל קובצי שמע להורדה ישירה?

לא, המאגר מכיל רק קובצי מטא-דאטה בפורמט jsonl עם מזהי הקבצים. עליכם להוריד את קובצי האודיו ישירות ממאגרי המקור של MLS, Common Voice ו־VCTK. לאחר ההורדה תצטרכו לעדכן את נתיבי השמע המקומיים ברשומות.

האם יש תמיכה בעברית?

אין תמיכה בעברית כלל. המאגר מוגבל לחמש שפות בלבד: אנגלית, גרמנית, צרפתית, איטלקית וספרדית. שימוש במאגר מיועד לפיתוח מודלים הפונים לשפות אלו.

האם מותר להשתמש במאגר לצרכים מסחריים?

הרישיון CDLA-Sharing-1.0 מתיר שימוש מסחרי, אך כולל תנאי שיתוף זהה שמחייב הפצה של שינויים בדאטהסט תחת אותו רישיון בדיוק. בנוסף יש לבדוק בנפרד את תנאי הרישיון של מאגרי האודיו מהם מגיעים קובצי הקול בפועל.

איך נאספו ונוצרו הנתונים במאגר?

הנתונים מתבססים על 14,000 שעות שמע ממאגרי דיבור פתוחים. החוקרים השתמשו במודלי שפה ובמודלי מומחה קיימים כדי לייצר באופן אוטומטי שאלות ותשובות על מאפייני ההקלטות והתוכן שלהן.

איך טוענים

טוענים את המידע ישירות בספריית datasets של Hugging Face לפי קטגוריה וחלוקה רצויה. חשוב לקחת בחשבון שהמאגר כולל רק קובצי jsonl עם מזהי אודיו וטקסט, ללא קובצי הקול עצמם. תצטרכו להוריד בנפרד את המאגרים החיצוניים, לחלץ את האודיו ולעדכן מקומית את הנתיב audio_path לכל רשומה לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("amazon-agi/SIFT-50M")

הרישיון

המאגר מופץ ברישיון CDLA-Sharing-1.0. הרישיון מאפשר שימוש מסחרי ומחייב ייחוס, אך כולל דרישת שיתוף זהה שמחייבת הפצה של שינויים בדאטהסט תחת אותו רישיון. קובצי האודיו עצמם כפופים לרישיונות המקוריים של המאגרים מהם נלקחו, ויש לוודא עמידה בהם בנפרד.

הרישיון המלא ב־Hugging Face ↗