GPT
M

MCIF

קוד פתוח

FBK-MTcc-by-4.02025-12-15

בנצ'מרק רב-לשוני ומולטימודלי של הרצאות מדעיות, עם תיוג אנושי שמחבר וידאו, שמע וטקסט. הוא נבנה כדי לבחון איך מודלים מתמודדים עם הוראות בשפות שונות על גבי תוכן ארוך וקצר.

  • 1,070הורדות בחודש
  • 70לייקים

מה זה

המאגר מכיל דגימות המבוססות על הרצאות מדעיות, ומיועד להערכת ביצועים ולא לאימון רחב היקף, עם פחות מאלף רשומות בסך הכל. כל רשומה מייצגת קלט מולטימודלי המשלב קובצי וידאו, שמע, תמלול טקסטואלי, והוראות שנכתבו בארבע שפות: אנגלית, גרמנית, איטלקית וסינית. הנתונים מתמקדים בארבע משימות מרכזיות שנלקחו מתוך ההרצאות: זיהוי דיבור, תרגום, מענה לשאלות וסיכום.

המבנה מחולק לארבעה פיצולים שונים לפי שני צירים עיקריים. הציר הראשון הוא אורך הקלט, עם חלוקה לקטעים קצרים וערוכים מראש או להרצאות שלמות וארוכות ללא חיתוך. הציר השני נוגע לסוג הפרומפט, כאשר יש גרסה של הוראות אחידות וקבועות לצד גרסה עם ניסוחים מגוונים. כל הפיצולים חולקים את אותם קובצי מדיה בסיסיים, ונתוני הייחוס לתשובות מופרדים ונמצאים בקובצי XML דחוסים.

מתאים ל

  • בחינת מודלים מולטימודליים

    מדידת הדיוק של מודלי שפה וראייה בהבנת הרצאות וידאו ארוכות ומענה על שאלות.

  • בדיקת הבנת הוראות בין-לשונית

    בדיקה איך המודל מגיב להנחיות באנגלית, סינית, איטלקית או גרמנית על אותו תוכן.

  • הערכת תרגום וזיהוי דיבור

    מדידת איכות של תמלול ותרגום אוטומטי בהקשר של הרצאות מדעיות עם מינוח מקצועי.

איפה זה נופל

זהו סט מבחן קטן מאוד ולא מאגר אימון, עם פחות מאלף רשומות שמתאימות בעיקר לבדיקת ביצועים נקודתית. השפות מוגבלות לארבע בלבד, והתוכן מגיע כולו מהקשר צר של הרצאות מדעיות. זה אומר שהשפה גבוהה והאוצר הטכני עשיר, כך שהתוצאות לא בהכרח ישקפו ביצועים בשיחות יומיומיות, שיחות שירות או סרטונים כלליים ברשת. בנוסף, תשובות הייחוס דורשות הצלבה ידנית מקובצי XML חיצוניים לפי מזהה, ואינן יושבות בתוך הרשומה הבסיסית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, רישיון CC-BY-4.0 מתיר שימוש מסחרי מלא. כל מה שנדרש לפי תנאי הרישיון הוא לתת קרדיט ברור למחברים ולציין אם בוצעו שינויים בקבצים.

האם יש במאגר נתונים בעברית?

לא. המאגר מוגבל לארבע שפות בלבד: אנגלית, גרמנית, איטלקית וסינית. כל ההוראות והמקורות נשענים על השפות האלו בלבד.

מאיפה הנתונים נאספו?

הבסיס מורכב מהרצאות מדעיות מוקלטות הכוללות וידאו, שמע ותמלול. התיוג וההוראות נבנו ועברו ולידציה אנושית כדי לבחון משימות מוגדרות של סיכום, מענה לשאלות, תרגום וזיהוי דיבור.

למה המאגר מחולק לקטעים קצרים וארוכים?

החלוקה מאפשרת לבחון את המודלים בשני תרחישים שונים. המסלול הקצר בודק הבנה ממוקדת של קטעי וידאו נקודתיים, בעוד המסלול הארוך בוחן את היכולת לעבד הקשר נרחב של הרצאה שלמה ברצף.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset רגילה עם שם הפיצול המבוקש, ללא צורך באישור גישה מיוחד. המאגר כולל 1,725 קבצים, והשדות העיקריים ברשומות הם מזהה ייחודי, נתיבים יחסיים לקובצי הווידאו והשמע, שדה תמלול שמופיע רק בקלטים הארוכים, והוראות מותאמות לשפות השונות. אם בוחנים משימות של מענה לשאלות, שדה המטא-דאטה מפרט את סוג השאלה לפי אופני הקלט ואת המקור שלה מתוך ההרצאה.

from datasets import load_dataset

ds = load_dataset("FBK-MT/MCIF")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, העתקה, הפצה ושינוי של החומרים לכל מטרה, כולל הערכה ופיתוח של מודלים. התנאי המרכזי היחיד הוא מתן קרדיט מתאים ליוצרים המקוריים וציון שינויים שבוצעו, ללא דרישה להפיץ עבודות נגזרות תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗