GPT
L

LaMini-instruction

קוד פתוח

MBZUAIcc-by-nc-4.02023-04-08

מאגר ענק של כמעט 2.6 מיליון הוראות ותשובות שנוצרו באמצעות זיקוק ידע. הוא מיועד למי שרוצה לאמן מודלים קטנים ביעילות בלי לייצר דאטה סינתטי מאפס.

  • 414הורדות בחודש
  • 147לייקים

מה זה

המאגר כולל 2.58 מיליון זוגות של הוראות ומענים באנגלית, שנבנו במטרה לאמן מודלי שפה קטנים בשיטת זיקוק ידע לא מקוון. כל רשומה מורכבת מטקסט ההוראה שמתאר את המשימה הנדרשת, טקסט התשובה שהופק ישירות על ידי מודל gpt-3.5-turbo, ומזהה המקור של ההוראה שמסווג מאיזה מאגר בסיס היא נלקחה.

ההוראות עצמן לא נכתבו כולן מאפס אלא נאספו ועובדו מתוך מספר מאגרי פרומפטים קיימים ומוכרים בתחום, בהם Alpaca, FLAN, P3 ו־self-instruct. השדה שמתעד את המקור מחלק את הדגימות לקטגוריות כמו הוראות מקוריות מול כאלו שחוללו מתוך FLAN או P3, וכן הוראות שנוצרו במסגרת self-instruct עם נושא מוגדר או בלעדיו. הכרטיס אינו מפרט תהליכי סינון ידניים או אוטומטיים נוספים שנעשו על הפלטים מעבר להרצה מול המודל של OpenAI.

מתאים ל

  • אימון מודלים קטנים

    כוונון עדין של מודלי שפה קומפקטיים על מגוון רחב של משימות הוראה באנגלית.

  • מחקר על זיקוק ידע

    בדיקת ההשפעה של פלטים סינתטיים ממודל גדול על ביצועי מודלי קוד פתוח.

  • הערכת עמידות להטיות

    ניתוח של כשלים והטיות שעוברים מדאטה סינתטי של מודל מסחרי למודלים נגזרים.

איפה זה נופל

התוכן כולו באנגלית בלבד, כך שהוא לא יעזור למי שמחפש לכוונן מודל בעברית. מאחר שכל התשובות סונתזו באביב 2023 באמצעות gpt-3.5-turbo, המאגר ירש ישירות את ההטיות, ההזיות וטעויות התוכן של המודל ההוא, כפי שמציינים החוקרים עצמם. מי שמתכנן להשתמש בנתונים צריך לבצע סינון ובקרת איכות עצמאית, כי הכרטיס לא מעיד על ניקוי שבוצע בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוגדר הוא cc-by-nc-4.0 שאינו מתיר שום שימוש מסחרי. כל מודל או תוצר שתאמנו על הדאטהסט הזה מוגבל למחקר אקדמי ולשימוש לא מסחרי בלבד. אם יש לכם צורך במוצר שמייצר הכנסות, תצטרכו לחפש מאגר חלופי.

האם הדאטהסט כולל תמיכה בעברית?

המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אין בו דוגמאות בעברית ואי אפשר להסתמך עליו לצורך שיפור ביצועי שפה מקומית. מי שבונה מודל לעברית יצטרך לתרגם את הנתונים או להשתמש במקורות אחרים.

איך הדאטהסט נאסף בפועל?

החוקרים לקחו פרומפטים ממאגרים קיימים כמו Alpaca, P3, FLAN ו־self-instruct. הם הזינו את ההוראות האלו ישירות למודל gpt-3.5-turbo של OpenAI ושמרו את התשובות שהוא יצר. התוצאה היא מאגר סינתטי מלא שמשקף את הידע והסגנון של המודל המקורי.

מה מייחד אותו לעומת מאגרים כמו Alpaca?

הוא גדול משמעותית ומגיע ל־2.58 מיליון דוגמאות לעומת עשרות אלפים בודדות ב־Alpaca המקורי. בנוסף, הוא מאחד תחת קורת גג אחת מגוון מקורות פרומפטים שונים ומסמן במפורש מאיזה מאגר הגיעה כל הוראה. זה מקל מאוד על ניתוח ההשפעה של סוגי משימות שונים על תוצאות האימון.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד. הנתונים מחולקים לשלושה קובצי Parquet שמרכיבים את סט האימון תחת תיקיית data, לצד קובץ הגדרות בפורמט JSON. כל דגימה מחזיקה שלושה שדות טקסט בלבד, instruction, response ו־instruction_source, כך שטעינה שגרתית בספריית datasets תעבוד מיד בלי צורך בעיבוד מקדים מורכב.

from datasets import load_dataset

ds = load_dataset("MBZUAI/LaMini-instruction")

הרישיון

המאגר שוחרר תחת רישיון cc-by-nc-4.0. המשמעות פשוטה: השימוש מותר למטרות מחקר ושימוש אישי בלבד, ומחייב מתן קרדיט ליוצרים. שימוש מסחרי מכל סוג אסור במפורש, ולכן מודל שתאמנו על הנתונים האלה לא יוכל להיכנס למוצר מסחרי או לשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗