GPT
O

open-instruct-v1

קוד פתוח

hakureiapache-2.02023-04-04

אוסף של הוראות ותשובות באנגלית לאימון מודלי שפה, שמאחד מקורות מוכרים לפורמט אחיד. מתאים למי שרוצה בסיס מוכן להוראות בלי לאסוף ולנקות לבד עשרה מאגרים שונים.

  • 310הורדות בחודש
  • 117לייקים

מה זה

המאגר כולל 222,650 רשומות שמיועדות לאימון מודלים במילוי הוראות (instruction following). היוצר לקח כמה מאגרי נתונים מוכרים מעולם הקוד הפתוח, ניקה אותם ואיחד הכל למבנה אחד. הקובץ המרכזי נקרא instruct_data.json, ולצדו יש תיקיית subsets עם חלוקה לפי המקורות.

ההרכב נשען על מקורות מגוונים. החלק הגדול ביותר מגיע מ־Self Instruct עם 82,599 דוגמאות, ואחריו Alpaca של סטנפורד עם 51,759 רשומות. שאר הדאטה מכיל תערובת של נתונים סינתטיים (33,143), דוגמאות מ־GPT-4 Instruct עם 18,194 רשומות, Code Alpaca לכתיבת קוד (18,019), Dolly של Databricks עם 15,015 דוגמאות, ועוד חלקים קטנים יותר כמו משחקי תפקידים (3,146) ומאגרים קטנים נוספים.

מתאים ל

  • אימון הוראות כללי

    כוונון עדין של מודלי שפה באנגלית למענה מדויק להנחיות משתמש.

  • אימון משולב לקוד ושיחה

    שימוש בתתי-האוספים של Code Alpaca ומשחקי תפקידים להרחבת יכולות ספציפיות.

  • מחקר והשוואת מקורות

    בדיקת השפעת תערובות שונות של נתונים סינתטיים מול נתונים שנאספו ידנית.

איפה זה נופל

המאגר כולו באנגלית בלבד. אין פה מילה אחת בעברית, כך שהוא לא יעזור ישירות למי שמפתח מודל לשוק המקומי. נקודה קריטית נוספת היא שחלקים גדולים ממנו, כמו Alpaca ו־GPT-4 Instruct, נוצרו באמצעות מודלים של OpenAI בתחילת 2023. מעבר לעובדה שהחומר ישן יחסית לקצב התחום, תנאי השימוש המקוריים של המודלים שיצרו את הדאטה מגבילים אימון מודלים מתחרים, וחשוב לקחת את זה בחשבון לפני שמכניסים אותו לפרויקט.

שאלות
נפוצות

האם הדאטהסט מתאים לעבודה בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אם המטרה היא אימון בעברית, תצטרכו לתרגם את החומר או לחפש נתונים מקומיים.

מותר להשתמש בו למוצר מסחרי?

הרישיון המוצהר בדף הוא Apache 2.0, שמאפשר שימוש מסחרי מלא. עם זאת, חלקים נרחבים מבוססים על פלטים סינתטיים של OpenAI, מה שיוצר סיכון משפטי שתלוי בפרשנות שלכם לתנאי השימוש שלהם.

מאיפה הנתונים הגיעו?

המאגר מאחד עשרה מקורות שונים שפורסמו ברשת. הבולטים שבהם הם Self Instruct, מאגר Alpaca, פלטים של GPT-4, ונתוני Dolly של חברת Databricks.

האם צריך להוריד את כל המאגר בבת אחת?

לא חובה. הקבצים מחולקים בתיקיית subsets לפי מקור הנתונים, כך שאפשר להוריד רק את החלקים שרלוונטיים לכם, כמו משימות קוד או משחקי תפקידים.

איך טוענים

הנתונים יושבים בקובצי JSON פשוטים, בלי צורך בבקשת גישה מיוחדת או באישור. אתם יכולים למשוך ישירות את instruct_data.json שמכיל את כל 222,650 הדוגמאות, או לפנות לתיקיית המשנה subsets ולטעון רק חלקים ספציפיים כמו קוד או שיחות מבוססות GPT-4. המבנה מאוחד, כך שלא תצטרכו להתאים סכמות שונות בין המקורות.

from datasets import load_dataset

ds = load_dataset("hakurei/open-instruct-v1")

הרישיון

המאגר מפורסם תחת רישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. יחד עם זאת, בגלל שהנתונים כוללים פלטים של מודלים כמו GPT-4 ו־Alpaca, קיים מתח משפטי ידוע מול תנאי השימוש של ספקיות המודלים שמהם נוצר המידע המקורי, בלי קשר לרישיון שסומן במאגר עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗