GPT
S

self_instruct

קוד פתוח

yizhongwapache-2.02023-03-02

מאגר נתונים לכיוונון מודלים להבנת הוראות, שנבנה בעיקר מיצירה עצמית של מודל שפה. הוא מאפשר אימון לביצוע משימות ללא צורך בתיוג אנושי יקר.

  • 697הורדות בחודש
  • 194לייקים

מה זה

המאגר מחולק לארבע תצורות שונות. החלק המרכזי כולל 82,612 דוגמאות אימון שנוצרו על ידי מנוע davinci של OpenAI, ומכיל הוראות והשלמות סינתטיות. בנוסף אליו, ישנן דגימות השוואה מתוך מאגרים קיימים, כולל חמישים אלף דוגמאות של הוראות שנכתבו על ידי מומחים מתוך Super Natural Instructions, ועוד 52,657 דוגמאות מתוך מאגר P3 שמקורן בתיוג המונים.

החלק האחרון משמש להערכה אנושית וכולל 252 משימות מגוונות שנכתבו על ידי מומחים בהשראת יישומים אמיתיים. במרבית התצורות המבנה כולל שני שדות טקסט בלבד, הוראה והשלמה. רק תצורת ההערכה כוללת שדות מורכבים יותר כמו מזהה משימה, שם היישום, קלט ופלט.

מתאים ל

  • אימון מודלים להבנת פקודות

    שימוש ברשומות הסינתטיות כדי ללמד מודלי בסיס לבצע משימות והוראות משתמש.

  • הערכת ביצועי מודל שפה

    הרצת בדיקות על תצורת ההערכה האנושית כדי לבחון יכולת התמודדות עם יישומים מציאותיים.

  • מחקר על דאטה סינתטי

    ניתוח איכות הפלטים ובניית אלגוריתמים לסינון ושיפור נתונים שנוצרו על ידי מכונה.

איפה זה נופל

הנתונים נוצרו ברובם על ידי מודל שפה ולא על ידי בני אדם. החוקרים עצמם בדקו מדגם של מאתיים הוראות ומצאו שארבעים ושישה אחוזים מהן סבלו מבעיות שונות, פגמים בהיגיון או ניסוח לקוי. המאגר כולו באנגלית בלבד ואין בו תמיכה בשפות אחרות. מעבר לכך, התוכן נוצר באמצעות מנוע ישן של OpenAI מסוף 2022, כך שהוא מביא איתו את ההטיות והמגבלות של אותו מודל, ולא מומלץ להכניס אותו ישירות לייצור בלי סינון קפדני.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

קוד המאגר והנתונים מוגדרים תחת רישיון apache-2.0 שמתיר שימוש מסחרי. יחד עם זאת, חלק גדול מהטקסטים הופק באמצעות davinci של OpenAI, מה שעלול להציב מגבלות חיצוניות על שימוש בפלטים לאימון מודלים מתחרים.

האם יש בדאטהסט תמיכה בשפה העברית?

לא, כל הנתונים במאגר נאספו ונוצרו בשפה האנגלית בלבד. מי שמעוניין לאמן מודל בעברית יצטרך לתרגם את הנתונים או להריץ את המתודולוגיה הזו מחדש.

כיצד הנתונים נאספו ונבנו?

החוקרים לקחו מודל בסיס של OpenAI ונתנו לו לייצר באופן מחזורי הוראות חדשות לצד קלטים ותשובות מתאימות. בנוסף לכך הם צירפו דגימות מתוך מאגרים קיימים כמו P3 ו־Super Natural Instructions לצורכי השוואה.

במה המאגר שונה מאוספי הוראות רגילים?

המאגר לא מתבסס רק על עבודת תיוג ידנית של בני אדם, אלא בעיקר על דאטה שנוצר באופן אוטונומי על ידי מודל שפה. הוא מציע פתרון זול יחסית לאיסוף עשרות אלפי דוגמאות אימון, אך מגיע עם שיעור שגיאות גבוה יותר.

איך טוענים

הטעינה מתבצעת ישירות דרך ספריית datasets באמצעות ציון המזהה של המאגר והתצורה הרצויה. אין צורך באישור גישה מוקדם או בהורדה ידנית מורכבת, שכן הגישה פתוחה לחלוטין. בקוד המקור נכלל קובץ הפעלה ייעודי self_instruct.py לצד תיעוד המאגר.

לפני הטעינה יש לבחור את החלק המתאים למשימה שלכם, משום שמבנה הנתונים משתנה בין תת המאגרים. בחלקים המיועדים לאימון תעבדו ישירות מול השדות prompt ו־completion, בעוד שחלק ההערכה מחזיק שדות אחרים לחלוטין שמייצגים את מבנה המשימה והתשובה האנושית.

from datasets import load_dataset

ds = load_dataset("yizhongw/self_instruct")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי של הקבצים והפצה מחודשת, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי. מודלים שאומנו על הנתונים אינם מחויבים ברישיון פתוח, אך חשוב לוודא שאימון מסחרי על פלטים סינתטיים של OpenAI תואם את תנאי השימוש החיצוניים שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗