GPT
F

ft-instruction-synthesizer-collection

קוד פתוח

instruction-pretrainother2024-06-18

אוסף מגוון של נתוני כוונון שנועד ללמד מודלים לייצר הוראות ותשובות מתוך טקסט גולמי. המאגר מתאים למי שרוצה לאמן מחולל דאטה עצמאי משלו לקראת קדם אימון מבוסס משימות.

  • 933הורדות בחודש
  • 62לייקים

מה זה

המאגר מרכז קובצי כוונון ששימשו לבניית מחולל הוראות מבוסס הקשר במסגרת מחקר של אימון מקדים רב משימתי. הרשומות מבוססות על שילוב של משימות קיימות בעולם עיבוד השפה הטבעית, כמו סיווג טקסט, מענה על שאלות כלליות, מענה על שאלות מתוך טבלאות וסיווג באפס דוגמאות. הדוגמאות מעובדות כך שכל רצף שנכנס למודל מחבר כמה דוגמאות שנלקחו מאותו מקור נתונים, וחישוב הלוס באימון מתבצע רק על זוגות ההוראה והתשובה.

התוכן נאסף ממקורות פתוחים מגוונים שכוללים בין היתר נתונים רפואיים כמו קוביד, שאלות הבנת הנקרא מתוך דיאלוגים ומשימות היסק מורכבות. המבנה מחולק לתיקיות לפי שמות המשימות והמקורות המקוריים, ובתוכן קובצי אימון ואימות בפורמט ג'ייסון לצד קובצי חלוקה ממוספרים. המטרה של המגוון הרחב הזה היא לייצר כלי שיודע להכליל על טקסטים גולמיים שלא ראה מעולם ולהפיק מהם זוגות של משימה ופתרון.

מתאים ל

  • אימון מחולל משימות

    כוונון מודל בסיס שיידע להפוך מסמכים גולמיים לזוגות של הוראה ומענה.

  • העשרת קדם אימון

    יצירת דאטה סינתטי רב משימתי מתוך ארכיון טקסטים כדי לשפר אימון מודלי שפה.

  • בנצ'מרק למשימות מגוונות

    בדיקת יכולות המודל במענה על שאלות והיסק לוגי על פני תחומים שונים.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, כך שהוא לא יעזור ישירות למי שבונה מנוע סינתזה בעברית. בנוסף, מדובר באוסף מקורות חיצוניים עם רמות איכות ותחומי עניין שונים, כולל נתונים ספציפיים לתקופות עבר כמו מגפת הקורונה. החוקרים לא פירטו סינונים אוטומטיים של רעלים או שגיאות, ולכן חובה לדגום ולבדוק את הפלטים לפני שמזריקים נתונים שנוצרו דרכו לתוך מודל מרכזי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון הכולל מסומן כאחר, והיוצרים מציינים במפורש שהאוסף מורכב ממקורות שונים. כל מקור כפוף לתנאים המקוריים שלו, ולכן שימוש מסחרי מחייב מעבר על הרישיונות של כל סט בנפרד.

האם המאגר כולל נתונים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל המשימות והמקורות שמפורטים בו נאספו באנגלית. כדי לעבוד בעברית תצטרכו לתרגם את הנתונים או להרכיב אוסף מקומי דומה.

איך בנויים הקבצים בתוך המאגר?

המאגר מחולק לתיקיות לפי משימות ומקורות, עם 132 קבצים בסך הכל. בכל תיקייה תמצאו קובצי ג'ייסון שמחולקים לאימון ואימות, לצד קובצי חלוקה מרובי שורות לעבודה יעילה.

איך טוענים

טוענים את הנתונים דרך ספריית הדאטהסטס או בקריאה ישירה של קובצי הג'ייסון והג'ייסון אל מתוך 132 הקבצים במאגר. אין צורך לבקש אישור גישה מיוחד והנתונים פתוחים להורדה מיידית. שים לב לדגש טכני קריטי של החוקרים, הטקסטים כבר כוללים בתוכם תווי התחלה וסיום רצף מפורשים. כשמבצעים טוקניזציה לאימון, חובה לכבות את הוספת הטוקנים המיוחדים האוטומטית כדי לא לייצר כפילויות שישבשו את המודל.

from datasets import load_dataset

ds = load_dataset("instruction-pretrain/ft-instruction-synthesizer-collection")

הרישיון

הרישיון מוגדר כאחר. המאגר הוא לקט של עשרות סטים שונים ממקורות עצמאיים, ולכל אחד מהם יש תנאים משלו. אי אפשר להניח שמותר להשתמש בזה למטרות מסחריות בלי לבדוק את הרישיון המקורי של כל תיקייה ותיקייה באוסף.

הרישיון המלא ב־Hugging Face ↗