GPT
V

Video-MME-v2

קוד פתוח

MME-Benchmarksmit2026-04-06

  • benchmark
  • video
  • multimodal
  • MCQ

המאגר מרכז 800 סרטוני יוטיוב באיכות גבוהה ו־3,200 שאלות רב-ברירה להערכת מודלי וידאו. המטרה כאן היא לבחון הבנה רציפה והסקה מורכבת במקום לאפשר למודל לנחש תשובות מבודדות.

  • 7,986הורדות בחודש
  • 48לייקים

מה זה

כל רשומה במבחן בנויה סביב סרטון בודד שמלווה בארבע שאלות אמריקאיות ספציפיות. השאלות מחולקות לקבוצות של עקביות יכולת כדי לבדוק תפיסה בסיסית, ולקבוצות של רצף הסקה שדורשות מעקב לאורך זמן ומענישות ניחוש של שלב סופי אם המודל כשל בשלבי הביניים. המידע כולל את מזהה הווידאו, השאלה, האפשרויות, התשובה הנכונה וסוג המשימה.

כל 800 הסרטונים נאספו מיוטיוב, כאשר יותר מ־80% מהם עלו לרשת בשנת 2025 או מאוחר יותר, וכמעט 40% פורסמו לאחר אוקטובר 2025. התוכן מתפרס על פני ארבעה תחומי-על שמפוצלים ל־31 תתי-קטגוריות מוגדרות היטב. בנוסף לטקסט ולסרטונים ברזולוציית 1080p, המאגר מספק קובצי כתוביות ברמת מילה וזמני הופעה עבור כל סרטון.

מתאים ל

  • בנצ'מרק למודלי וידאו

    הרצת הערכה מובנית על 3,200 שאלות כדי למדוד יכולות הבנה, שליפה והסקה של מודלי שפה-ווידאו.

  • מדידת עקביות הסקה

    בדיקת שרשראות חשיבה לאורך סרטון שלם ובחינה אם המודל עוקב נכון אחרי שינויי מצב בזמן.

  • אימון הבנת וידאו וכתוביות

    שימוש בטקסט המתומלל עם חותמות הזמן לצד הווידאו כדי לכוונן מודלים שמשלבים אודיו, טקסט ותמונה.

איפה זה נופל

החומר כולו מבוסס על אנגלית בלבד ולכן אינו מתאים לבדיקת יכולות בעברית או בשפות אחרות. כל המדיה מגיעה מיוטיוב, מה שמייצר הטיה ברורה לתכנים פופולריים וערוכים מהפלטפורמה ולא לווידאו תעשייתי, רפואי או ממצלמות אבטחה. בנוסף, המבנה מוגבל לשאלות רב-ברירה בלבד, כך שהוא מודד יכולת בחירה מתוך אופציות נתונות ולא יצירת טקסט חופשי. מי שמתכנן מוצר שפועל על וידאו גולמי מהשטח יצטרך לבדוק את המודל על דאטה משלו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

המאגר מוגדר ברישיון MIT, שמאפשר עקרונית שימוש מסחרי, מחקרי ושינוי של החומרים. עם זאת, כל הסרטונים נלקחו מיוטיוב, ולכן זכויות היוצרים על חומרי הווידאו עצמם שייכות ליוצרי התוכן המקוריים. מומלץ לוודא שהשימוש שלכם תואם לזכויות היוצרים לפני שאתם מפיצים מודל שאומן עליהם.

האם יש במאגר תמיכה בעברית?

לא, כל השאלות, התשובות והכתוביות מתועדות באנגלית בלבד. המאגר מתאים לבחינת מודלים על שפה זו ולא יסייע בהערכת הבנת שפה טבעית בעברית. אם המערכת שלכם מיועדת לעברית, תצטרכו להביא מקורות נפרדים.

כמה המאגר שוקל ואיך הוא בנוי טכנית?

הטבלה עצמה שמורה בקובץ Parquet קל של 3,200 שורות, אך הווידאו כולל 800 קובצי MP4 ברזולוציית 1080p המקודדים ב־H265. הסרטונים אורגנו ב־40 ארכיוני זיפ נפרדים, ובנוסף יש קובץ זיפ של כתוביות בפורמט JSONL. מדובר בנפח הורדה של עשרות ג'יגה-בייט שמחייב חיבור מהיר ושטח אחסון פנוי.

מה מבדיל את הגרסה הזו ממאגרי וידאו אחרים?

הדגש כאן הוא על בדיקת עומק ההסקה באמצעות קטיעת ניקוד בטעות ראשונה. במקום שאלות נפרדות שלא תלויות זו בזו, כל סרטון כולל ארבע שאלות שבודקות את רצף החשיבה, כך שניחוש מוצלח של השלב האחרון לא מזכה בניקוד אם השלבים הקודמים נכשלו. רוב הסרטונים הועלו החל משנת 2025, מה שמקטין דליפת נתונים לאימון מודלים ותיקים.

איך טוענים

טוענים את קובץ test.parquet כדי לגשת לטבלת השאלות והתשובות, ללא צורך בהרשאת גישה מיוחדת. הסרטונים עצמם מקודדים בפורמט H265 ומחולקים ל־40 קובצי זיפ רציפים, מ־001.zip ועד 040.zip, כשבכל אחד 20 סרטונים. לצד אלה יש להוריד את subtitle.zip שמכיל 800 קובצי JSONL עם תמלול לפי זמנים. השדות החשובים לריצה הם השאלה, האפשרויות, התשובה הנכונה, סוג המשימה ומזהה הווידאו שמקשר לסרטון המתאים.

from datasets import load_dataset

ds = load_dataset("MME-Benchmarks/Video-MME-v2")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב בקוד סגור, כל עוד שומרים על הודעת זכויות היוצרים המקורית והפטור מאחריות. אין חובה לשתף נגזרות באותו רישיון. למרות זאת, כיוון שהסרטונים נאספו מיוטיוב, מומלץ לבדוק אם יש מגבלות זכויות יוצרים על התוכן הוויזואלי עצמו לפני שמשלבים אותו ישירות במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗