GPT
C

Cambrian-Alignment

קוד פתוח

nyu-visionxapache-2.02024-06-04

מאגר יישור למודלי ראייה שמרכז שאלות ותשובות מרובות מקורות. הוא נועד למי שמאמן מודל ויזואלי ורוצה בסיס מגוון בלי לאסוף ידנית כמה פרויקטים שונים.

  • 6,489הורדות בחודש
  • 38לייקים

מה זה

המאגר כולל רשומות של שאלות ותשובות על תמונות, בהיקף שנע בין מיליון לעשרה מיליון דוגמאות. במקום לייצר הכל מאפס, החוקרים אספו ואיחדו כאן נתוני אליינמנט מארבעה מקורות מוכרים: LLaVA, Mini-Gemini, Allava ו־ShareGPT4V. המטרה היא להביא שיחות, שאלות ממוקדות ותיאורים מפורטים של תוכן חזותי במקום אחד, כדי לשפר את ההבנה והתגובה של המודל מול קלט ויזואלי.

כרטיס המאגר לא מפרט תהליכי סינון, ניקוי או הסרה של כפילויות, ומפנה למאמר המלא למידע נוסף. מבחינת חלוקה טכנית, הקבצים מאורגנים לפי מקורות המידע, כאשר חלקים ספציפיים כמו allava ו־sam מפוצלים למספר קובצי ארכיון נפרדים בגלל מגבלות גודל של פלטפורמת האחסון.

מתאים ל

  • אימון יישור ויזואלי

    כוונון שלב היישור במודלי שפה וראייה גדולים בעזרת סט נתונים רחב ומגוון.

  • מענה לשאלות על תמונות

    שיפור יכולת המודל לענות על שאלות מורכבות ומפורטות סביב תוכן חזותי.

  • הערכת ביצועי ראייה

    בדיקת איכות התשובות של מודלים קיימים מול נתונים ממספר מקורות מובילים.

איפה זה נופל

הנתונים באנגלית בלבד ואין בהם מילה אחת בעברית. הכרטיס אינו מפרט הטיות, חסרונות או מתודולוגיית סינון, אלא שולח למאמר החיצוני. מאחר שמדובר באיחוד של סטים קיימים כמו ShareGPT4V ו־LLaVA, המגבלות והטעויות של אותם מקורות מגיעות ישירות לכאן, ומודל שתאמנו עליו ידרוש אימות זהיר מול נתונים אמיתיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

הרישיון שמופיע במאגר הוא Apache 2.0, שמתיר שימוש מסחרי חופשי למדי. עם זאת, הנתונים נאספו ממאגרים אחרים כמו LLaVA ו־ShareGPT4V, ולכן כדאי לבדוק את תנאי המקורות המקוריים לפני שמכניסים אותו ישירות למוצר.

האם המאגר כולל עברית?

לא. הדאטהסט מוגדר באנגלית בלבד. אם אתם מכוונים לממשק או למוצר מקומי, תצטרכו לתרגם את השאלות והתשובות או להוסיף נתונים בעברית בעצמכם.

כמה מקום אחסון צריך בשבילו?

נפח האחסון הנדרש גדול מאוד. קבצי allava ו־sam בלבד חולקו למספר ארכיוני tar כיוון שחרגו מ־50 גיגה-בייט, ומלבד ההורדה של עשרות הקבצים תצטרכו שטח פנוי נוסף לאיחוד ולחילוץ שלהם.

איך טוענים את הנתונים לעבודה?

הם לא מגיעים בפורמט מוכן לטעינה בשורה אחת של קוד. צריך להוריד את כל חלקי ה־tar, להריץ סקריפט איחוד בפייתון, ואז לחלץ את התוכן לתיקיית העבודה.

איך טוענים

אין צורך באישור גישה מיוחד, המאגר פתוח להורדה. מדובר ב־71 קבצים, שכוללים ארכיוני tar מחולקים כמו allava ו־sam, מכיוון שחלקם עברו את רף 50 הגיגה-בייט. תצטרכו נפח אחסון מקומי משמעותי מאוד וסקריפטים של פייתון כדי לאחד את החלקים ולחלץ אותם לפני שתוכלו לעבוד עם הנתונים בפועל.

from datasets import load_dataset

ds = load_dataset("nyu-visionx/Cambrian-Alignment")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף את המודל המאומן תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗