GPT
W

wit

קוד פתוח

googlecc-by-sa-3.02022-05-02

מאגר ענק של 37.6 מיליון זוגות תמונה וטקסט מוויקיפדיה בלמעלה ממאה שפות. הוא נועד למי שצריך לאמן מודלים מולטימודליים ולא רוצה להסתפק באנגלית בלבד.

  • 258הורדות בחודש
  • 71לייקים

מה זה

המאגר מכיל מעל 37 מיליון רשומות המקושרות ל־11.5 מיליון תמונות ייחודיות מתוך 108 שפות שונות בוויקיפדיה. כל רשומה כוללת קישור לתמונה, כתובת הדף, כותרת הערך, כותרת הפסקה, ומגוון תיאורי טקסט שנלקחו ישירות מהעמוד כמו כיתוב התמונה, תיאור המקור מוויקישיתוף, וטקסט חלופי עבור קוראי מסך. יש כאן גם טקסטים מההקשר הרחב יותר של הפסקה והערך עצמו.

האיסוף התבסס על כ־124 מיליון דפי תוכן בוויקיפדיה ב־279 שפות, תוך סינון דפי שיחה והערות. כדי לשמור על איכות, החוקרים דיללו תמונות גנריות שחזרו על עצמן לעיתים קרובות מדי ללא הקשר ספציפי לערך, כמו דגלים, לוגואים ומפות. איכות הנתונים נבדקה גם באמצעות דגימות של מתייגים אנושיים שדירגו את התאמת התיאור לתמונה. כל המידע מרוכז בחלוקה יחידה של אימון ללא פיצול מובנה למבחן.

מתאים ל

  • אימון מודלי אחזור

    התאמת טקסט חופשי לתמונות רלוונטיות מתוך מאגר גדול בעזרת קישורי התמונות וכיתובי הערכים.

  • יצירת כיתוב תמונה

    אימון מודלים שמקבלים תמונה ומייצרים תיאור מילולי מפורט בשפות שאינן אנגלית.

  • קדם-אימון מולטימודלי

    בניית ייצוגים משותפים של ראייה ושפה על פני עשרות שפות שונות בו-זמנית מתוך נתוני ויקיפדיה.

איפה זה נופל

התמונות עצמן לא מאוחסנות כאן אלא רק כקישורים, וחלק מהקישורים ברשת עלולים להישבר או להשתנות עם הזמן. בנוסף, חלוקת השפות מוטה מאוד. יש תשע שפות בלבד עם מעל מיליון דוגמאות, בעוד שפות רבות כוללות רק כמה עשרות אלפים. החוקרים עצמם מודים שהיו צריכים לדלל ידנית סמלים ומפות שחזרו על עצמם, כך שרמת הדיוק של הטקסט ביחס לתמונה אינה אחידה ותלויה בדרך שבה עורכי ויקיפדיה תיארו את המדיה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אבל הוא כולל סעיף שיתוף זהה שמחייב שחרור תוצרים באותו אופן. אם אתם בונים מודל סגור או קנייני, שימוש בנתונים האלה עלול לסבך אתכם משפטית לגבי שחרור המשקלים. מומלץ להתייעץ עם עורך דין לפני שמתחילים לאמן עליו מוצר.

האם המאגר כולל עברית?

רשימת השפות הרשמית שנבדקה בכרטיס המאגר כוללת שפות כמו ערבית, בולגרית וקטלאנית, ועברית אינה מופיעה ברשימת הקודים הראשית שם. עם זאת, האיסוף המקורי בוצע מכלל דפי התוכן של ויקיפדיה, כך שייתכן שישנם מופעים בעברית בתוך 108 השפות. כדאי לסנן את שדה השפה מראש ולבדוק כמה דוגמאות קיימות בפועל לפני שמסתמכים עליו.

כמה מקום צריך בשביל להוריד אותו?

קובצי המטא-דאטה והטקסט שוקלים מעט יחסית ונטענים במהירות דרך הספרייה. הסיפור האמיתי הוא התמונות, שלא מגיעות מוכנות בדיסק אלא רק ככתובות אינטרנט. כדי לשמור 11.5 מיליון תמונות ייחודיות ברזולוציה מקורית תצטרכו עשרות טרה-בייטים של אחסון ותשתית הורדה מסיבית.

איך המידע נאסף?

החוקרים סרקו כ־124 מיליון דפי תוכן בכל שפות ויקיפדיה ושלפו תמונות יחד עם הטקסט שהקיף אותן. הם אספו את הכיתוב שמתחת לתמונה, את התיאור מתוך ויקישיתוף ואת הטקסט החלופי לקוראי מסך. לאחר מכן הם סיננו החוצה תמונות גנריות כמו דגלים וסמלים, וביצעו בקרת איכות מדגמית עם בודקים אנושיים.

איך טוענים

טוענים את המאגר דרך ספריית datasets באמצעות הקריאה הרגילה לשם המאגר. הקבצים ב־Hugging Face כוללים בעיקר את מטא-הנתונים וסקריפט הטעינה, בלי התמונות עצמן. המאגר מספק כתובות URL בלבד, כך שאתם צריכים לכתוב תהליך נפרד שיוריד את מיליוני קובצי התמונה מהרשת, משימה שדורשת רוחב פס רציני, אחסון מקומי משמעותי והתמודדות עם קישורים שבורים. השדות העיקריים לעבודה הם image_url יחד עם שדות הכיתוב השונים.

from datasets import load_dataset

ds = load_dataset("google/wit")

הרישיון

הרישיון הוא CC-BY-SA 3.0. מותר להשתמש בנתונים למטרות מסחריות ולשנות אותם, אבל חובה לתת קרדיט מתאים. הבעיה המרכזית היא דרישת השיתוף הזהה, שמחייבת הפצה של יצירות נגזרות תחת אותו רישיון בדיוק. מפתחים רבים נמנעים מאימון מודלים קנייניים על רישיון כזה מחשש שהמודל או משקליו ייחשבו כיצירה נגזרת.

הרישיון המלא ב־Hugging Face ↗