GPT
M

multimodal_textbook

קוד פתוח

DAMO-NLP-SGapache-2.02025-01-01

  • Pretraining
  • Interleaved
  • Reasoning

מאגר לאימון מודלי שפה ותמונה שמחבר צילומי מסך מתמלילי שיעורים מקוונים. הוא נותן רצף מסודר של תמונות וטקסט להבנת חומרי לימוד במדעים.

  • 3,984הורדות בחודש
  • 164לייקים

מה זה

הנתונים מבוססים על 75 אלף סרטוני הדרכה באנגלית שנבחרו מתוך מאגר ראשוני של 159 אלף סרטונים, לאחר סינון של תכנים כפולים או ירודים. הבחירה התבססה על טקסונומיה של 3,915 נקודות ידע בששה מקצועות ליבה כמו מתמטיקה, פיזיקה וכימיה, שנבנתה בעזרת GPT-4o.

כל רשומה בנויה בפורמט משולב הדומה למבנה של OBELICS, שבו מערך תמונות ומערך טקסט מופיעים לסירוגין עם ערכי null שמגדירים את הסדר. הטקסט כולל תמלול דיבור אוטומטי וטקסט שחולץ מהמסך באמצעות OCR, לצד מטא נתונים על זמני הסרטון והערכות איכות שנוצרו במקור על ידי מודלים.

המאגר כולל 610 אלף דגימות מאוחדות שנוצרו מחיבור קטעי וידאו שונים. המפרסמים מציעים שני קובצי אנוטציה מרכזיים, כשאחד מהם עבר סינון ייעודי להסרת מרבית התמונות שכוללות פני אדם.

מתאים ל

  • אימון מודלי ראייה ושפה

    לימוד קשרים מורכבים בין דיאגרמות מדעיות להסברים קוליים וטקסטואליים.

  • חילוץ מידע ממצגות לימודיות

    אימון מערכות OCR והבנת מסמכים לזיהוי מבנה שיעורים מקוונים.

  • סיכום תוכן מולטימודלי

    פיתוח מודלים שמפיקים תקציר משולב של תמונות מפתח ותמלולי שיעור.

איפה זה נופל

כל התוכן מוגבל לשפה האנגלית בלבד, ואין כאן ייצוג לחומרי לימוד מקומיים או בעברית. בנוסף, הטקסט מבוסס על מערכות ASR ו־OCR אוטומטיות, מה שמביא לשגיאות פענוח במונחים טכניים או בנוסחאות מורכבות. המאגר נשען על סרטוני רשת ואינו כולל בחינה אנושית מלאה של נכונות המידע המדעי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומתיר שימוש מסחרי ישיר. עליכם לכלול עותק של הרישיון המקורי וייחוס ליוצרים. המודלים שמאומנים על הדאטהסט אינם כפופים לחובת שיתוף קוד פתוח.

כמה שטח אחסון צריך להכין להורדה?

המאגר כולו דורש מעל 600 גיגה בייט של שטח דיסק עבור קובצי התמונות לבדם. בנוסף, קובץ האנוטציות שוקל 11 גיגה בייט. תצטרכו שטח פנוי נוסף לצורך תהליך האיחוד והחילוץ של קובצי הארכיון.

האם יש במאגר תכנים בעברית?

לא, המאגר מוגדר ומכיל נתונים בשפה האנגלית בלבד. כל תמלולי השיעורים ושאילתות החיפוש נאספו לפי טקסונומיה באנגלית. שימוש בעברית ידרוש איסוף מקביל או תרגום מותאם.

איך נאספו התמונות והטקסטים?

היוצרים בנו טקסונומיה של ידע בעזרת GPT-4o ואספו לפיה סרטוני הדרכה מיוטיוב. מסרטונים אלה חולצו פריימים מרכזיים, תמלולי אודיו אוטומטיים וטקסטים מתוך התמונות בעזרת OCR. לאחר מכן קטעי הווידאו חוברו לרצפים ארוכים של טקסט ותמונה לסירוגין.

איך טוענים

טעינת המאגר דורשת הורדה של קובץ JSON בנפח 11 גיגה בייט ועשרים קובצי ארכיון מפוצלים של תמונות בנפח כולל של כ־600 גיגה בייט. יש לאחד את קובצי התמונות בפקודת שרשור בקונסולה לפני החילוץ. נתיבי התמונות בקובץ הנתונים מקודדים כנתיבים מוחלטים מקומיים של החוקרים, כך שחובה להחליף אותם בנתיב המקומי שלכם לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("DAMO-NLP-SG/multimodal_textbook")

הרישיון

המאגר מופץ ברישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של הנתונים ואינו מחייב שיתוף באותו רישיון. מותר לאמן עליו מודלים מסחריים, כל עוד שומרים על הודעת הרישיון ומתן קרדיט כנדרש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗