GPT
W

wit_base

קוד פתוח

wikimediacc-by-sa-4.02022-05-02

  • text-image-retrieval

מעל שישה מיליון תמונות מוויקיפדיה עם טקסטים נלווים בלמעלה ממאה שפות. המאגר כולל את קובצי התמונה עצמם ואמבדינגס מוכנים, בלי שתצטרכו להוריד מיליוני כתובות רשת בעצמכם.

  • 4,564הורדות בחודש
  • 75לייקים

מה זה

המאגר מבוסס על פרויקט WIT של גוגל ומכיל 6,477,255 רשומות. כל רשומה מייצגת תמונה אחת שרוחבה הוקטן ל־300 פיקסלים תוך שמירה על יחס התצוגה המקורי, לצד וקטור ייצוג של 2048 ממדים שנשלף ממודל ResNet-50 שאומן על ImageNet. בניגוד לגרסה המקורית שחילקה את המידע לפי עמודים, כאן קיבצו לכל תמונה את כלל התיאורים וההקשרים מכל שפות ויקיפדיה שבהן היא מופיעה, כדי למנוע כפילות של בתים.

הטקסטים נאספו מתוך כ־124 מיליון ערכי ויקיפדיה ב־279 שפות. כל דוגמה כוללת כתוביות שמופיעות מתחת לתמונה, טקסט אלטרנטיבי לנגישות, שמות ערכים, כותרות פסקאות ותיאורים קצרים. תמונות שסומנו למחיקה ב־Wikimedia Commons הוסרו מהמאגר, ובוצע סינון באמצעות RetinaFace שהשמיט כל תמונה שבה פני אדם תופסים יותר מעשרה אחוזים משטחה.

כל המידע מרוכז בפיצול יחיד של אימון, ללא חלוקה מובנית מראש לקבוצות ולידציה או מבחן.

מתאים ל

  • אימון כיתוב תמונה

    יצירת כיתובים אוטומטיים לתמונות מתוך התיאורים הרב-לשוניים שנאספו מעמודי ויקיפדיה.

  • אחזור טקסט מתמונה

    התאמת תיאור טקסטואלי רלוונטי לתמונה מתוך מאגר נתון בעזרת וקטורי ResNet-50 המוכנים.

  • חיפוש מולטימודלי רב-לשוני

    בניית מנועי חיפוש שמקשרים בין שאילתות טקסט בעשרות שפות שונות לבין קובצי תמונה.

איפה זה נופל

חלק גדול מהתמונות המקוריות סונן מראש, תמונות של אנשים כמעט ואינן קיימות בגלל הסרת פנים מעל עשרה אחוזים מהשטח, ותמונות נפוצות כמו סמלילים, מפות ודגלים עברו דילול אגרסיבי. בנוסף, כל הנתונים נמצאים בפיצול אימון יחיד, כך שחובה להגדיר חלוקת ולידציה ומבחן באופן עצמאי. ישנן גם 120 דוגמאות שתוקנו עקב פורמט שגוי במקור. הכרטיס אינו מפרט נתונים ספציפיים לגבי היקף העברית, אם כי שפות אחרות מקבלות כיסוי רחב.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי סגור?

הרישיון הוא CC BY-SA 4.0 שמתיר שימוש מסחרי, אך דורש מתן קרדיט ושיתוף באותו רישיון עבור יצירות נגזרות. אם המודל המאומן ייחשב כיצירה נגזרת, תיאלצו לשחרר את המשקלים שלו תחת אותו רישיון פתוח. למוצרים קנייניים סגורים זה עלול להוות סיכון משפטי ממשי.

האם יש בדאטהסט תמיכה בעברית?

הכרטיס מציין שהמאגר מבוסס על כל שפות ויקיפדיה שבהן היו תמונות עם תיאור, אך ברשימת השפות המפורטת בעמוד מופיעים רק קודים בודדים ואין ציון מפורש של עברית (he). כדאי לסנן ולבדוק את שדה השפה לפני שמתבססים עליו לפרויקט ייעודי בעברית.

מה ההבדל בין המאגר הזה לגרסה המקורית של גוגל?

גוגל סיפקה רק קובצי טקסט עם כתובות אינטרנט של התמונות וחילקה את המידע לפי עמודים. הגרסה של ויקימדיה כוללת את קובצי התמונה עצמם בגודל מוקטן, אמבדינגס מוכנים, ומאגדת את כל השפות של אותה תמונה ברשומה אחת.

איך טוענים

הנתונים מחולקים ל־331 קובצי Parquet בתוך הפיצול train. אין צורך בבקשת גישה מיוחדת, אך טעינה מלאה דורשת נפח אחסון משמעותי לעיבוד שבע ספרות של תמונות. חשוב לדעת שגישה לעמודת התמונה מחלצת ומפענחת את הקובץ אוטומטית כ־PIL Image, פעולה שגוזלת זמן רב. לכן חובה לגשת קודם לאינדקס של השורה ורק אז לעמודת התמונה, ולא לבצע שליפה של כל העמודה בבת אחת. השדות החשובים למידול הם image או embedding, לצד רשימת wit_features שמכילה את הטקסטים לפי קוד שפה.

from datasets import load_dataset

ds = load_dataset("wikimedia/wit_base")

הרישיון

המאגר מופץ תחת רישיון CC BY-SA 4.0. שימוש מסחרי מותר, אך מחייב מתן קרדיט מתאים ליוצרים. המכשול המרכזי לפיתוח הוא תנאי השיתוף הזהה, שמחייב כל יצירה נגזרת להיות מופצת תחת אותו הרישיון בדיוק. אם תאמנו מודל ויוחלט שהמשקלים או התוצרים שלו מוגדרים כיצירה נגזרת, תהיו חייבים לפתוח אותם ברישיון זהה, דבר שלא מתאים למוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗