GPT
D

DenseFusion-1M

קוד פתוח

BAAIcc-by-4.02024-06-04

  • GPT-4V
  • MLLM

מאגר שמספק תיאורי תמונות צפופים ומפורטים ברמות דיוק שונות, החל ממיקומי עצמים ועד טקסט בתמונה. מי שבונה מודל רב-מודאלי וצריך כיתובים עמוקים במקום תיאורים שטחיים של משפט אחד ימצא בו עניין.

  • 4,645הורדות בחודש
  • 44לייקים

מה זה

המאגר כולל תיאורים חזותיים מקיפים שנבנו באמצעות שילוב מומחי ראייה ממוחשבת שונים, כשהרעיון הוא לחלץ פרטים עשירים כמו טקסט מתוך תמונה, זיהוי אובייקטים, מיקומים מדויקים במרחב וידע חיצוני על התוכן המוצג. התוצאה מיועדת לענות על שאלות חזותיות ולאפשר תפיסה חזותית מפורטת למודלי שפה רב-מודאליים.

התוכן מחולק לשני חלקים עיקריים לפי מקור הייצור שלהם. החלק הגדול הוא קובץ שנוצר על ידי מנוע הכיתוב הייעודי של החוקרים דרך שיטת המיזוג התפיסתי שלהם, והחלק השני, שנקרא DenseFusion-4V-100k, נוצר באמצעות GPT-4V על בסיס אותה גישת מיזוג. התמונות עצמן מאורגנות בארכיוני zip נפרדים.

מתאים ל

  • אימון מודל שפה רב-מודאלי

    לימוד הבנה חזותית עמוקה בעזרת תיאורים מפורטים הכוללים מיקומי עצמים וטקסט בתוך תמונה.

  • מענה על שאלות חזותיות

    אימון ובדיקה של מערכות Visual QA שדורשות התייחסות לפרטים קטנים ומורכבים ברחבי הפריים.

  • יצירת תמונות מטקסט צפוף

    שימוש בתיאורים מפורטים כדי לכוונן מודלי יצירת תמונה שמגיבים לפרומפטים ארוכים ומדויקים.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאם אתם עובדים על פרויקט בעברית תצטרכו לתרגם את התיאורים או להסתמך על תמונות בלבד. הכרטיס לא מציין מאיפה התמונות המקוריות נאספו, האם סוננו תכנים פוגעניים, או מה טווח הגיל של הנתונים, ולכן יש סיכון להטיות מובנות או בעיות זכויות יוצרים בתמונות המקוריות. בנוסף, חלק מהטקסט נוצר על ידי מודלים ומנועי כיתוב, מה שמחייב לבדוק הזיות בתיאורים ובזיהוי המיקומים לפני שמזינים אותם לאימון של מודל קריטי.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד, וכל התיאורים שנוצרו על ידי המנועים נכתבו באנגלית. אם המוצר שלכם פונה לשוק המקומי, תצטרכו לתרגם את הטקסטים בעצמכם.

האם מותר להשתמש בו למוצרים מסחריים?

הרישיון המוצהר הוא cc-by-4.0 ובכרטיס הוזכר גם רישיון MIT, ושניהם מאפשרים שימוש מסחרי בכפוף למתן קרדיט. עם זאת, מכיוון שחלק מהנתונים נוצרו באמצעות GPT-4V, כדאי לוודא שתנאי השימוש של OpenAI לא מגבילים את האימון שאתם מתכננים.

איך מחולקים הקבצים במאגר?

המאגר מורכב מ־162 קבצים. ישנם קובצי jsonl עם התיאורים והמטא-דאטה, ולצידם סדרה של קובצי zip ממוספרים המכילים את התמונות הגולמיות.

מאיפה הגיעו התמונות והתיאורים?

התיאורים יוצרו על ידי שילוב של מומחי תפיסה חזותית, כאשר חלקם נכתבו על ידי מנוע ייעודי של BAAI וחלקם על ידי GPT-4V. מקור התמונות הגולמיות עצמן אינו מפורט בכרטיס הדאטהסט.

איך טוענים

הנתונים יושבים במבנה של קובצי jsonl עבור הטקסט, לצד תיקיית תמונות שמחולקת לקובצי zip ממוספרים, כך שאין צורך להתמודד עם קובץ ענק בודד אבל כן תצטרכו לפרוק 162 קבצים שונים. הגישה למאגר פתוחה ישירות ולא דורשת בקשת הרשאה מיוחדת. כדי להשתמש בזה תצטרכו לקרוא את קובצי ה־jsonl, לחבר בין הרשומות לבין התמונות שנפרקו מהארכיונים, ולעבד את שדות התיאור והתיוג שמגיעים מהמומחים השונים.

from datasets import load_dataset

ds = load_dataset("BAAI/DenseFusion-1M")

הרישיון

לפי המטא-דאטה המאגר מסומן תחת רישיון cc-by-4.0, שמאפשר שימוש מסחרי, הפצה מחדש ושינויים, כל עוד נותנים ייחוס מתאים ליוצרים. עם זאת, בטקסט הכרטיס המפרסמים ציינו גם את רישיון MIT לפרויקט. בשני המקרים מותר לאמן מודלים לשימוש פנימי או מסחרי, אבל כדאי לשים לב לחוסר האחידות בין הרישום הרשמי לטקסט החופשי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗