GPT
C

Cambrian-10M

קוד פתוח

nyu-visionxapache-2.02024-05-30

מאגר ענק של קרוב לעשרה מיליון דוגמאות שמיועד לאימון מודלי שפה רב מודליים על הוראות ויזואליות. הוא מתאים למי שרוצה לשפר יכולות ראייה מורכבות בלי לפגוע בביצועי הטקסט של המודל.

  • 15,005הורדות בחודש
  • 131לייקים

מה זה

המאגר כולל בערך 9.784 מיליון רשומות המשלבות תמונות עם שאלות ותשובות, לצד חלק קטן של נתוני הוראות טקסטואליים בלבד שנועדו למנוע שכחה של יכולות שפה. המידע נאסף מכמה מקורות: מאגרי עבר של שאלות ותשובות ויזואליות וזיהוי תווים כמו AI2D ו־ALFWorld, מנוע איסוף ייעודי שחילץ תמונות ופסקאות מוויקיפדיה לפי נושאים שהוגדרו בעזרת מודלי שפה, ודוגמאות שנכתבו מחדש על ידי GPT-4V ו־GPT-4o כדי לייצר תשובות ארוכות ויצירתיות יותר.

היוצרים מציעים גם גרסה מסוננת ומאוזנת יותר בשם Cambrian-7M. בגרסה הזו יש חלוקה מוגדרת שכוללת כ־34.5% דאטה כללי, כ־27.2% זיהוי תווים, 21% טקסט בלבד, ופלחים קטנים יותר שמוקדשים לספירה, מתמטיקה, מדעים וקוד.

מתאים ל

  • אימון הוראות ויזואלי

    כוונון מודלי שפה רב מודליים לעבודה עם תמונות ומענה על שאלות מורכבות.

  • שיפור משימות OCR

    אימון על פלח הנתונים הגדול של זיהוי טקסט בתוך תמונות ותרשימים.

  • שימור יכולות שפה

    שילוב נתוני טקסט טהור לצד תמונות כדי למנוע שכחה של יכולות שיחה כלליות.

איפה זה נופל

המאגר מוגדר כולו באנגלית ואין בו נתונים בעברית, כך שהוא לא יעזור ישירות למשימות מקומיות. חלק משמעותי מהשאלות, התשובות והניסוחים נוצר באופן סינתטי על ידי מודלים של OpenAI, מה שעלול להכניס שגיאות עובדתיות או הזיות שמקורן במודל שיצר את המידע. בנוסף, המפתחים מציינים בעיה של התנהגות כמכונת תשובות יבשה, וממליצים להשתמש בגרסה המסוננת עם פרומפט מערכת כדי לרכך אותה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח הוא Apache 2.0, שמאפשר שימוש מסחרי חופשי למדי בכפוף למתן ייחוס ושמירה על תנאי הרישיון. יחד עם זאת, חלק מהטקסטים נוצרו באמצעות מודלים של OpenAI, ומומלץ לוודא שתנאי השימוש של אותם מודלים אינם מתנגשים עם היעד הסופי שלכם.

האם המאגר כולל עברית?

לא. המאגר מסומן וכולל נתונים בשפה האנגלית בלבד. אם המוצר שלכם מיועד לעבודה בעברית, תצטרכו לאסוף או לתרגם נתונים ממקורות אחרים.

באיזו גרסה של הדאטה כדאי להתחיל לאמן?

יוצרי המאגר ממליצים לאמן על גרסת Cambrian-7M המסוננת שכוללת פרומפט מערכת, ולא על הגרסה המלאה של עשרה מיליון דוגמאות. הגרסה הזו כוללת יחס נתונים מאוזן יותר בין שפה, זיהוי תווים וראייה כללית, ומסייעת למנוע תשובות לקוניות.

כמה מקום בדיסק צריך בשביל להשתמש בו?

הכרטיס אינו מציין נפח כולל מדויק, אך מדובר בעשרה מיליון תמונות המחולקות לעשרות קובצי ארכיון שחלקם מגיעים למגבלת 50 הגיגה-בייט לקובץ יחיד. תזדקקו לכונן ייעודי של כמה מאות גיגה-בייט לפחות לצורך הורדה, איחוד וחילוץ.

איך טוענים

אין צורך באישור גישה כדי להוריד את המאגר, אבל נדרש נפח אחסון מקומי משמעותי מאוד. המאגר מכיל 76 קבצים, בעיקר ארכיוני tar.gz של תמונות, שחלקם פוצלו למספר קבצים בגלל מגבלת הגודל של 50 גיגה-בייט. תהליך העבודה דורש להוריד את הקבצים, להריץ סקריפט איחוד לקבצים המפוצלים של allava ושל מנוע האיסוף, ולחלץ אותם. קובצי המטא-דאטה מגיעים בפורמט JSONL, וכוללים קבצים ייעודיים לכלל המאגר, לגרסת ה־7M המסוננת, ולגרסה שכוללת פרומפט מערכת מובנה.

from datasets import load_dataset

ds = load_dataset("nyu-visionx/Cambrian-10M")

הרישיון

המאגר מפורסם תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר מודלים שאימנתם תחת אותו הרישיון, כל עוד אתם שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗