GPT
2

220k-GPT4Vision-captions-from-LIVIS

קוד פתוח

laionapache-2.02023-11-21

יש כאן גם סקירה על LAION עצמו.

220,000 תיאורי תמונות מפורטים ומדויקים עובדתית עבור מאגר LVIS. מקור טוב לאימון מודלי ראייה שפה שמחפשים תיאורים עשירים שנוצרו מדיאלוגים סביב תמונות.

  • 1,070הורדות בחודש
  • 64לייקים

מה זה

המאגר כולל 220,000 רשומות המבוססות במקור על תמונות מתוך LVIS. הבסיס לטקסט מגיע ממאגר קודם שנקרא LVIS-Instruct4V, שכלל דיאלוגים מורחבים בין משתמש לבוט סביב תוכן התמונות. המפתחים לקחו את השיחות האלו ותמצתו אותן לכדי תיאור רציף ועובדתי אחד עבור כל תמונה.

התקצור נעשה בעזרת מודל השפה Mistral-7B-OpenOrca, שהונחה במפורש להוציא רק פרטים עובדתיים ותיאוריים שהופיעו בדיאלוג בלי להמציא דבר, ולהתחיל את התשובה בנוסח קבוע שנחתך החוצה בסוף התהליך. התוצאה היא טקסט נקי יחסית מנימוסי שיחה, שמתמקד בתיאור ויזואלי ישיר ומפורט של מה שמופיע בתמונה המקורית.

מתאים ל

  • אימון מודלי ראייה שפה

    חיבור תיאורים מילוליים עשירים לתמונות מתוך LVIS כדי לשפר הבנה ויזואלית.

  • הערכת מודלי יצירת תיאור

    בדיקת איכות יצירת תיאורים מול טקסט מפורט שסוכם מדיאלוג מובנה.

  • אימון מודלי אחזור תמונה

    התאמת שאילתות טקסטואליות מורכבות ומרובות פרטים לתמונות מתאימות.

איפה זה נופל

הטקסט כולו באנגלית ואין כאן עברית כלל. התמונות לא שמורות בקובץ אלא מקושרות בכתובות רשת, מה שאומר שקישורים שבורים עלולים לצמצם את כמות הנתונים בפועל. בנוסף, מדובר בסיכום מכונה של שיחות שנוצרו על ידי מכונה, כך שהזיות או חוסר דיוק שהיו בדיאלוג המקורי של LVIS-Instruct4V חלחלו ישירות לתיאורים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי ישיר. עליכם רק לתת קרדיט ליוצרים, לצרף את תנאי הרישיון ולציין אם שיניתם את הקבצים.

האם הקובץ כולל את התמונות עצמן?

לא. הקובץ המרכזי שמופיע במאגר הוא lvis_caption_url.parquet, וממנו מבינים שמקבלים קישורים לתמונות ולא את קובצי התמונה עצמם.

האם יש במאגר נתונים בעברית?

לא, כל תהליך יצירת התיאורים והפרומפטים התבסס על אנגלית בלבד. אם תרצו לאמן מודל לעברית, תצטרכו לתרגם את התיאורים בעצמכם.

איך נוצרו התיאורים בדאטהסט?

היוצרים לקחו שיחות ממאגר LVIS-Instruct4V ותמצתו אותן באמצעות המודל Mistral-7B-OpenOrca. המודל קיבל הנחיה לחלץ רק עובדות מהשיחה בלי תוספות.

איך טוענים

המאגר פתוח לגישה ישירה בלי צורך באישור מיוחד או מילוי טופס. הנתונים עצמם שמורים בקובץ lvis_caption_url.parquet, אותו טוענים ישירות דרך ספריית datasets הרגילה של Hugging Face. לפי שם הקובץ, הוא מחזיק את התיאור שנוצר יחד עם כתובת התמונה ברשת, כך שאת התמונות עצמן צריך להוריד בנפרד לפי הקישורים.

from datasets import load_dataset

ds = load_dataset("laion/220k-GPT4Vision-captions-from-LIVIS")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כל עוד אתם מצרפים קרדיט מתאים, עותק של הרישיון וציון השינויים שביצעתם. אין חובה לשתף נגזרות באותו הרישיון, מה שמקל על שילובו בפיתוח מודלים פנימיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗