GPT
M

MAmmoTH-VL-Instruct-12M

קוד פתוח

MAmmoTH-VLapache-2.02024-11-29

  • reasoning
  • CoT
  • math

אוסף ענק של הוראות ויזואליות שנועד ללמד מודלים מולטימודליים לפתור בעיות מורכבות צעד אחר צעד. מי שמאמן מודל ראייה ושפה ימצא כאן מענה מפורט לתמונות, במיוחד בתחומי המדע והמתמטיקה.

  • 6,946הורדות בחודש
  • 66לייקים

מה זה

המאגר מכיל מיליוני דוגמאות של מענה לשאלות על גבי תמונות, עם דגש על תשובות מפורטות ומנומקות בתחומי המדעים והמתמטיקה. תהליך הבנייה שלו כלל איסוף ידני של מקורות מידע, שכתוב מחדש של התשובות באמצעות מודלי שפה ומודלים מולטימודליים כדי לייצר הסברים מפורטים, ולבסוף סינון איכות שבוצע באמצעות מודל ששימש כשופט.

מבנה הקבצים במאגר מחולק לשני קובצי נתונים מרכזיים, mammoth_si_10M שכולל עשרה מיליון רשומות, וקובץ נוסף mammoth_ov_2M המכיל שני מיליון רשומות. לצד קובצי הטקסט, התמונות עצמן ארוזות בעשרות קובצי ארכיון מחולקים, כולל תיקייה ייעודית עבור דוגמאות שמשלבות מספר תמונות במקביל.

מתאים ל

  • אימון מודלי שפה ויזואליים

    כוונון עדין של מודלי ראייה להבנת תמונות מורכבות ומענה מנומק.

  • פתרון בעיות מתמטיקה ומדע

    לימוד מודלים לפתור תרשימים ומשוואות שלב אחר שלב מתוך תמונה.

  • הבנת רצף תמונות

    אימון על דוגמאות הכוללות מספר תמונות ברשומה אחת לצורך השוואה.

איפה זה נופל

הנתונים כולם באנגלית בלבד. אם אתם מכוונים למודל בעברית, המאגר הזה לא ייתן לכם מענה ישיר בלי תרגום משמעותי. מעבר לזה, רוב התשובות כאן הן סינתטיות ועברו שכתוב וסינון על ידי מודלים אחרים, מה שמייצר סיכון של חזרתיות, הזיות שהשתרבבו פנימה והטיות שמאפיינות מודלי שפה גדולים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא apache-2.0, שמאפשר שימוש מסחרי חופשי ואימון מודלים מסחריים. תצטרכו רק להקפיד על מתן קרדיט וייחוס כנדרש בתנאי הרישיון.

האם יש במאגר שאלות או תשובות בעברית?

לא, כלל הנתונים המדווחים במאגר הם בשפה האנגלית בלבד. לצורך עבודה בעברית תצטרכו לתרגם את הטקסטים בעצמכם או להסתמך על מאגרים אחרים.

כיצד נוצרו התשובות המפורטות בדאטהסט?

החוקרים אספו מקורות מידע קיימים ושכתבו את התשובות בעזרת מודלי שפה גדולים ומודלים מולטימודליים. לאחר מכן, אותם מודלים שימשו כשופטים שסיננו החוצה דוגמאות שלא עמדו ברף האיכות.

איך בנויים הקבצים להורדה?

המידע הטקסטואלי מחולק בעיקרו לשני קובצי JSON של שני מיליון ועשרה מיליון רשומות. הוויזואליה מפוצלת ל־144 קבצים הכוללים ארכיונים מכווצים, חלקם מיועדים למשימות עם תמונה בודדת וחלקם לריבוי תמונות.

איך טוענים

אין צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך Hugging Face. עם זאת, מדובר ב־144 קבצים שכוללים ארכיונים דחוסים רבים של תמונות, ולכן תצטרכו תשתית אחסון גדולה מאוד ורוחב פס רציני כדי לפרוק אותם. העבודה השוטפת נעשית מול קובצי ה־JSON שמכילים את ההוראות והשאלות, כאשר התמונות נטענות מתוך קובצי ה־tar הדחוסים.

from datasets import load_dataset

ds = load_dataset("MAmmoTH-VL/MAmmoTH-VL-Instruct-12M")

הרישיון

המאגר שוחרר ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים ואימון מודלים ללא חובת פתיחת הקוד שלכם, בתנאי שתשמרו על הודעת זכויות היוצרים ותתנו ייחוס מתאים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗