GPT
S

seamless-interaction

קוד פתוח

facebookcc-by-nc-4.02025-06-23

  • webdataset
  • audio
  • video

מעל 4,000 שעות וידאו ואודיו של אינטראקציות פנים אל פנים בין יותר מ־4,000 משתתפים. המאגר מציע סנכרון נדיר בין דיבור, הבעות פנים ותנועות גוף תלת-ממדיות למחקר רב-מודאלי מורכב.

  • 71,787הורדות בחודש
  • 196לייקים

מה זה

המאגר מכיל שיחות מונחות בין זוגות משתתפים בשתי קטגוריות עיקריות. קטגוריית Improvised מבוססת על תרחישים מובנים עם שחקן מקצועי אחד לפחות, בעוד קטגוריית Naturalistic מציגה שיחות חופשיות יותר בין אנשים רגילים. הנתונים נאספו מכמה ספקים ואתרים שונים ברחבי העולם לפי מפרט טכני אחיד, אם כי רמת ההפקה והמשחק משתנה בין האתרים.

כל אינטראקציה כוללת קובץ וידאו באיכות 1080p בקצב של 30 או 29.97 פריימים לשנייה, אודיו נקי מופרד ערוצים ב־48kHz, תמלול מסונכרן בזמן, זיהוי דיבור פעיל (VAD), ונתוני תנועה תלת-ממדיים כמו מודלי גוף מסוג SMPL-H ונקודות ציון של הפנים והגוף. בנוסף מופיעים מאפייני תנועה והבעה שהופקו ממודל חיקוי, לצד תיוגים אנושיים של מצבים רגשיים פנימיים ורציונל התנהגותי עבור חלק קטן מהשעות. החלוקה הכללית מורכבת מאימון, פיתוח ומבחן המאורגנים בקובצי ארכיון עצמאיים.

מתאים ל

  • אימון סוכני שיחה מונפשים

    למידת תזמון מחוות, קשר עין ותנועות גוף מסונכרנות לפי הדיבור בזמן אמת.

  • מידול דינמיקת דיאלוג

    זיהוי תורות דיבור, תגובות גופניות הדדיות וניתוח הבעות פנים תוך כדי שיחה.

  • פיתוח מערכות שיחות וידאו

    שחזור פוזה תלת-ממדית והבנת סימנים חברתיים בלתי מילוליים בשידור חי.

איפה זה נופל

בערך עשרה אחוזים מהאינטראקציות כוללים שגיאות בסנכרון הזמנים האנושי, כמו חיתוך מוקדם או מאוחר מדי של המקטע הפעיל ואי התאמה קלה בין התמליל למילים שנאמרו בפועל. ישנם גם מקרים נדירים של בלבול במזהי המשתתפים, שבהם אותו מזהה ניתן לאנשים שונים או שאדם בודד קיבל מזהים מרובים. הבדלי האיכות בין אתרי ההקלטה השונים מורגשים גם הם, בעיקר בזליגת קול בין הערוצים, יציאה של משתתפים מגבולות הפריים, ורמת אמינות משתנה של התיוגים. בנוסף, חסר כאן מידע על מגוון השפות שנבדקו ועל נתוני עברית בפרט, וכל הזמן שבין התרחישים, שבו המשתתפים קראו הנחיות או נחו, נחתך החוצה ולא שוחרר.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון כאן הוא cc-by-nc-4.0 ולכן השימוש המסחרי חסום לחלוטין. כל מה שנבנה או מאומן עליו ישירות מוגבל למחקר, פיתוח פנימי ואקדמיה, אלא אם קיבלתם אישור פרטני מחברת מטא.

כמה שוקל הדאטהסט המלא והאם חובה להוריד הכל?

המאגר המלא שוקל כ־27TB וכולל אלפי קובצי ארכיון כבדים. ממש לא חייבים להוריד הכל, והוא בנוי כך שתוכלו למשוך דוגמה בודדת של 100MB, מקבץ מדגם של 1GB, או אצווה יחידה של כ־50GB לפיתוח מקומי.

האם יש במאגר שיחות בשפה העברית?

החומר הרשמי לא מציין קיום של דוברי עברית ומתמקד בשיחות באנגלית מאתרי איסוף שונים. אם אתם מחפשים תמלולים או סנכרון שפתיים בעברית, לא הייתי בונה על המאגר הזה בלי לבדוק תחילה דגימה ידנית.

אילו בעיות סנכרון קיימות בנתונים לפי המפתחים?

בכרטיס מדווח שכעשרה אחוזים מהמקטעים סובלים מאי-דיוקים בחותמות הזמן האנושיות, כמו תחילת מקטע מאוחרת או חוסר התאמה בין הטקסט לדיבור. בנוסף יש לעיתים זליגות שמע בין שני המיקרופונים באתרי הקלטה מסוימים.

איך טוענים

הורדת המאגר המלא דורשת התמודדות עם נפח עצום של כ־27TB, כך שלרוב עדיף להתחיל מקובצי ארכיון בודדים דרך WebDataset או מדגימות של סשנים ספציפיים. אין צורך בטופס גישה מיוחד, והקבצים מחולקים לאצוות של כ־50GB בפורמט tar שיושבות ב־Hugging Face וב־S3. הצוות מספק מאגר קוד ב־GitHub יחד עם אפליקציית Streamlit מובנית שמאפשרת לדפדף באינטראקציות, לסנן לפי תוויות ולצפות בסרטונים מסונכרנים לצד נתוני ה־NPZ וה־JSONL לפני שמתחילים למשוך טרה-בייטים שלמים לכונן המקומי.

from datasets import load_dataset

ds = load_dataset("facebook/seamless-interaction")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0 שמיועד אך ורק למטרות מחקר ולא לשימוש מסחרי. מותר להעתיק, לשנות ולפתח מודלים על בסיס הנתונים כל עוד ניתן ייחוס ברור ליוצרים ומצוינים השינויים שנעשו, אך אין היתר למכור את הדאטהסט או להשתמש בו ישירות במוצרים שמייצרים רווח כלכלי בלי הסכם נפרד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗