GPT
R

Recap-DataComp-1B

קוד פתוח

UCSC-VLAAcc-by-4.02024-06-04

המאגר מכיל 1.3 מיליארד תמונות עם תיאורים חדשים ומפורטים שנוצרו על ידי מודל ראייה שפה. הוא מיועד למי שרוצה לאמן מודלי ראייה בלי הרעש של טקסטים מקוריים מהרשת.

  • 12,231הורדות בחודש
  • 205לייקים

מה זה

הנתונים מתבססים על 1.3 מיליארד צמדי תמונה וטקסט שנלקחו מתוך DataComp-1B, מאגר שנאסף במקור מסריקת רשת מתוך מאגר גולמי של 12.8 מיליארד פריטים. החוקרים השתמשו במודל LLaVA-1.5 מבוסס LLaMA-3-8B כדי לסנתז כיתובים חדשים ועשירים לכל תמונה במקום הטקסט המקורי מהאינטרנט. הפענוח נעשה באמצעות greedy decoding כדי ליצור תיאורים סמנטיים עקביים.

כל רשומה כוללת כתובת אינטרנט של התמונה, את הכיתוב המקורי שנאסף מהרשת, את הכיתוב החדש שנוצר על ידי המודל, ומזהה גיבוב מסוג sha256 של הקובץ. הסינון של המאגר המקורי כלל בדיקות בטיחות, הסרת כפילויות, וסינון לפי מדדי CLIP ומאפייני תמונה.

מתאים ל

  • אימון מודלי CLIP

    שיפור ביצועי zero-shot ואחזור מידע חוצה-מודלים באמצעות כיתובים מפורטים ועקביים.

  • אימון מודלי דיפוזיה

    אימון מחוללי תמונה מטקסט שצריכים להבין הנחיות מורכבות ומפורטות טוב יותר.

  • אימון מודלי כיתוב תמונה

    בניית מודלי תמונה לטקסט שמייצרים תיאורים עשירים על בסיס דוגמאות איכותיות.

איפה זה נופל

הכיתובים נוצרו על ידי מודל בינה מלאכותית, ולכן הם כוללים הזיות, טעויות זיהוי והטיות מובנות של מודל הבסיס. המקור הוא סריקת רשת רחבה, כך שהתמונות עדיין עלולות להכיל תוכן בעייתי או מידע אישי שלא סונן במלואו. הכרטיס לא מציין תמיכה בעברית, והתיאורים מבוססים על אימון המודל באנגלית. אם אתם בונים מערכת שדורשת דיוק עובדתי מוחלט או מידע רגיש, המאגר הזה פשוט לא מתאים.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא כל עוד אתם מספקים ייחוס מתאים ליוצרים. עם זאת, התמונות עצמן נמצאות ברשת ולא מאוחסנות במאגר, כך שתצטרכו לקחת בחשבון את זכויות היוצרים של התמונות המקוריות שתורידו.

האם המאגר כולל את קובצי התמונות עצמם?

לא. המאגר מורכב מקובצי Parquet שמכילים כתובות אינטרנט של התמונות לצד הכיתובים. תצטרכו להריץ תהליך הורדה נפרד של התמונות באמצעות הכתובות ולוודא את תקינותן באמצעות מזהי הגיבוב.

האם המאגר מתאים לעבודה בעברית?

הכרטיס אינו מדווח על תמיכה בעברית, והכיתובים סונתזו באמצעות LLaMA-3 ו־LLaVA שמתמקדים באנגלית. אם אתם מאמנים מודל לשפה העברית, תצטרכו לתרגם את הטקסטים או לחפש מקור נתונים אחר.

מה ההבדל בינו לבין DataComp-1B הרגיל?

ב־DataComp-1B המקורי, הטקסטים נאספו ישירות מקוד ה־HTML של אתרי אינטרנט והיו קצרים או מלאי רעש. במאגר הזה, החוקרים לקחו את אותן התמונות והחליפו את הטקסטים בכיתובים מפורטים שנוצרו על ידי מודל ראייה שפה כדי לשפר את איכות האימון.

איך טוענים

הנתונים מחולקים ליותר מ־4,620 קובצי Parquet, לצד קובץ תצוגה מקדימה נפרד. אין כאן תמונות שמורות, אלא רק כתובות URL, כך שתצטרכו להוריד את התמונות בעצמכם משרתי המקור ברשת ולהתמודד עם קישורים שבורים. השדות הקריטיים לעבודה הם כתובת התמונה והכיתוב המסונתז. הגישה למאגר פתוחה ישירות דרך המאגר בהאגינג פייס ללא צורך באישור ידני.

from datasets import load_dataset

ds = load_dataset("UCSC-VLAA/Recap-DataComp-1B")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, מחקרי והתאמה של הנתונים, בתנאי שאתם נותנים קרדיט מתאים ליוצרים ומציינים אם ערכתם שינויים. אין דרישה לשתף תוצרים או מודלים באותו רישיון, אך יש לזכור שהרישיון מכסה את מטא הנתונים והטקסטים, בזמן שהתמונות עצמן יושבות באתרי צד שלישי וכפופות לתנאי המקור שלהן.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗