GPT
L

LLaVA-Instruct-150K

קוד פתוח

liuhaotiancc-by-4.02023-04-17

המאגר כולל הוראות מעורבות של תמונה וטקסט שנוצרו באמצעות מודל שפה. הוא מתאים למי שרוצה לאמן מודל ראייה ושפה שמסוגל לענות על שאלות מורכבות סביב תמונות.

  • 5,458הורדות בחודש
  • 635לייקים

מה זה

הרשומות במאגר הן נתוני הוראות מולטימודליות שנוצרו על ידי פנייה לממשק של מודל GPT-4-0314 באפריל 2023. המטרה של איסוף המידע הייתה לבנות יכולות ראייה וטקסט שמתקרבות לאלו של המודלים המתקדמים ביותר, באמצעות אימון ייעודי על שיחות והסברים ויזואליים.

התוכן מחולק לקבצים שונים לפי סוג המשימה וההיקף שלה. בין הקבצים תמצאו 77 אלף דוגמאות של חשיבה מורכבת סביב תמונה, 58 אלף דוגמאות של שיחות מרובות שלבים, וקובץ של 23 אלף דוגמאות לתיאורים מפורטים, לצד קבצים מאוחדים שמגיעים גם להיקף נרחב יותר כמו קובץ המיקס שמכיל 665 אלף רשומות.

מתאים ל

  • אימון הוראות מולטימודלי

    כוונון של מודלי שפה וראייה כך שידעו לענות על שאלות מורכבות סביב תמונות.

  • בניית צ'אטבוט ויזואלי

    פיתוח ממשקי שיחה שמסוגלים לנהל דיאלוג רציף על תוכן של תמונה.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של נתונים שנוצרו על ידי מכונה על ביצועי מודלי ראייה פתוחים.

איפה זה נופל

הנתונים מבוססים כולם על יצירה סינתטית של מודל מוקדם יחסית מאפריל 2023, ולכן הם כוללים את כל ההטיות והטעויות שהמודל הזה מייצר. הדאטהסט כולו באנגלית בלבד, ואין בו שום ייצוג לשפה העברית או להקשרים מקומיים. בנוסף, מדובר בטקסטים בלבד שמתייחסים לתמונות חיצוניות, כך שתצטרכו לוודא שיש לכם גישה למקור התמונות עצמו לפני שתוכלו להתחיל לאמן בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון עצמו הוא רישיון חופשי מסוג CC-BY-4.0, אבל הכרטיס מציין במפורש חובת ציות לתנאי השימוש של OpenAI. המשמעות היא שלא בטוח שתוכלו להשתמש בו לאימון מודל שמיועד להתחרות ישירות בשירותים שלהם. כדאי להתייעץ עם גורם משפטי לפני שילוב שלו במוצר מסחרי.

האם המאגר כולל עברית?

לא, המאגר כולו מוגדר באנגלית בלבד. כל השיחות, השאלות והתשובות הופקו באנגלית מול מודל השפה. אם המטרה שלכם היא לבנות מודל שמבין עברית, תצטרכו לתרגם את הנתונים או לחפש מקור אחר.

איך אספו ויצרו את הנתונים בפועל?

היוצרים פנו לממשק ה־API של GPT-4-0314 באפריל 2023 עם פרומפטים מובנים. המודל ייצר שיחות, תיאורים מפורטים ודוגמאות חשיבה סביב תמונות. התוצאה חולקה לקבצים שונים לפי סוג המשימה והאינטראקציה.

באילו קבצים כדאי להשתמש מתוך המאגר?

זה תלוי במטרת הניסוי שלכם ובמשאבי המחשוב. ישנם קבצים ממוקדים כמו שיחות או חשיבה מורכבת של עשרות אלפי רשומות, וישנם קבצים מלאים ומעורבים שמגיעים למאות אלפי דוגמאות. מומלץ להתחיל בקובץ קטן שמתאים למשימה כדי לבדוק את התהליך.

איך טוענים

הנתונים מגיעים בקובצי JSON פשוטים, ביניהם קובץ הבסיס של 150 אלף הדוגמאות או קובצי החלוקה לפי נושאים, ולא נדרש אישור גישה מיוחד כדי להוריד אותם מהמאגר. כל רשומה כוללת את מבנה ההוראות והתשובות שנוצרו בפנייה למודל, יחד עם הפניות לתמונות המתאימות לצורך אימון המודל הוויזואלי. לפני שמתחילים כדאי לבחור את הקובץ המתאים להיקף האימון שאתם מתכננים, בין אם זו חלוקה ספציפית לחשיבה מורכבת או קובץ מעורב גדול.

from datasets import load_dataset

ds = load_dataset("liuhaotian/LLaVA-Instruct-150K")

הרישיון

הרישיון המדווח הוא CC-BY-4.0 שמאפשר שימוש והתאמה בכפוף למתן קרדיט מתאים. עם זאת, הכרטיס מדגיש שהשימוש כפוף גם לתנאי השימוש של חברת OpenAI, מכיוון שהנתונים הופקו דרך הממשק שלה. מגבלה זו עלולה להערים קשיים משפטיים על מי שמתכנן להשתמש בתוצרים לפיתוח מודל שמתחרה ישירות בשירותים שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗