GPT
O

Open-Qwen2VL-Data

קוד פתוח

weizhiwangmit2024-09-27

המאגר מרכז תמונות וטקסטים מסוננים מראש לאימון מודלים מולטימודליים. הוא מיועד למי שרוצה לאמן מודל ראייה ושפה על משאבים אקדמיים נגישים בלי להתחיל לגרד ולסנן את הרשת בעצמו.

  • 13,677הורדות בחודש
  • 25לייקים

מה זה

הנתונים מחולקים לשלושה חלקים עיקריים שנועדו להזנת מודלים מסוג תמונה לטקסט. החלק הראשון מכיל דוגמאות מתוך CC3M, CC12M ו־SBU שעברו סינון באמצעות CLIP, ישירות מגרסה מעובדת של פרויקט BLIP. שני החלקים האחרים מבוססים על מאגר DataComp-Medium בהיקף של 128 מיליון דוגמאות מקוריות, אך כוללים רק תתי-קבוצות מובחרות.

הסינון בחלקים של DataComp התבסס על מזהים ייחודיים שפורסמו בפרויקט DFN. החלק השלישי משלב בין הסינון של DFN לבין סינון נוסף בשיטת MLM-Filter, שהתמקד בהבנה סמנטית לפי סף מוגדר של 85. התוצאה היא אוסף ממוקד של צמדי תמונה וכיתוב שנבחרו כדי להוריד רעש וזבל מהאינטרנט.

מתאים ל

  • אימון מקדים של מודלי ראייה

    מתאים לשלב ה־pre-training של מודלי תמונה-טקסט הזקוקים למידע מסונן באיכות טובה יחסית.

  • שחזור מחקר Open-Qwen2VL

    אימון מודלים מקבילים לפי ההגדרות והחלוקות ששימשו את החוקרים במאמר המקורי.

  • השוואת שיטות סינון נתונים

    בדיקת ביצועים של מודלים מול החלק שסונן ב־DFN בלבד לעומת החלק ששילב סינון סמנטי.

איפה זה נופל

הכרטיס לא מפרט אילו שפות נכללות מעבר לאנגלית, וסביר להניח שעברית כמעט ולא קיימת כאן, אם בכלל. כל הנתונים מבוססים על גזירות וסינונים של סטים ותיקים מהרשת, כך שההטיות של מאגרי המקור כמו DataComp ו־CC נשארות בפנים. בנוסף, חסר פירוט מלא על חלוקה מובנית למבחן מול אימון.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן, רישיון MIT מאפשר שימוש מסחרי חופשי, כל עוד אתם מצרפים את תנאי הרישיון המקורי. כדאי לזכור שהתמונות עצמן הגיעו ממקורות רשת מגוונים, אך המאגר הנוכחי מוגדר כחופשי לשימוש.

האם יש במאגר טקסטים בעברית?

הכרטיס לא מזכיר עברית ולא מדווח על תמיכה רב-לשונית. המאגרים שעליהם הוא מתבסס מורכבים בעיקר מאנגלית, ולכן לא הייתי בונה עליו לאימון מודל שמיועד להבין עברית.

איך הנתונים נאספו וסוננו?

היוצרים לקחו תת-קבוצה מעובדת של BLIP מתוך CC3M, CC12M ו־SBU. בנוסף, הם לקחו מזהים מתוך DataComp-Medium וסיננו אותם בעזרת מודל DFN וסינון הבנה סמנטית של MLM-Filter.

באיזה פורמט הקבצים מגיעים?

הנתונים מסודרים בתצורת WebDataset וכוללים מעל עשרת אלפים קבצים, בעיקר ארכיוני tar, קובצי parquet וקובצי json עם סטטיסטיקות. הפורמט הזה מיועד להזרמה מהירה של תמונות וטקסטים בזמן אימון.

איך טוענים

הנתונים שמורים במבנה של WebDataset, מה שאומר שתעבדו מול אלפי קובצי tar, parquet וקובצי סטטיסטיקה מלווים. יש במאגר מעל עשרת אלפים קבצים, כך שמומלץ להזרים אותם ישירות לסביבת האימון ולא לנסות לפרוק הכל מראש לתיקייה מקומית. אין צורך לבקש אישור גישה מיוחד, פשוט מתחברים עם ספריית הנתונים הרגילה וטוענים את החלק הרלוונטי לאימון.

from datasets import load_dataset

ds = load_dataset("weizhiwang/Open-Qwen2VL-Data")

הרישיון

המאגר מפורסם תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של הרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗