GPT
G

general-instruction-augmented-corpora

קוד פתוח

instruction-pretrainodc-by2024-06-24

מאגר ענק של 200 מיליון זוגות הוראה ותשובה שנוצרו סינתטית מתוך טקסט גולמי. הוא מיועד למי שרוצה לאמן מודל בסיס חזק יותר מראש, במקום להסתפק באימון מקדים רגיל.

  • 7,912הורדות בחודש
  • 24לייקים

מה זה

המאגר מכיל 40 מיליון קטעי טקסט מועשרים בהוראות, שכוללים יחד 200 מיליון זוגות הוראה ותשובה ביותר מ־40 קטגוריות משימה. המקור לכל החומר הזה הוא תת קבוצה מתוך קורפוס RefinedWeb הגולמי. החוקרים השתמשו במודל ייעודי שיצר את ההוראות והתשובות מתוך ההקשר של הטקסט, במטרה להפוך טקסט רשת רגיל למשימות מגוונות כמו מענה על שאלות וסיווג.

הקבצים במאגר מחולקים לפורמט json עם ספליטים של train ו־valid, לצד אלפי קובצי טקסט מחולקים לשארדים תחת תיקיות ייעודיות. החוקרים ממליצים לערבב את הטקסטים המועשרים האלה עם טקסט גולמי רגיל במהלך האימון כדי לא לאבד כיסוי ידע כללי.

מתאים ל

  • אימון מקדים מאפס

    בניית מודלי שפה בסיסיים שיודעים לעקוב אחרי הוראות ומשימות עוד לפני שלב ה־fine-tuning.

  • המשך אימון למודל קיים

    הרחבת יכולות של מודלים קיימים כמו Llama3 כדי לשפר ביצועים במשימות רב משימתיות.

  • מחקר על דאטה סינתטי

    בדיקת השפעת שילוב טקסט שנוצר על ידי מכונה בתוך קורפוס אימון מקדים בהיקף גדול.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן שום ייצוג לעברית. כל ההוראות והתשובות סונתזו על ידי מודל שפה פתוח ולא נכתבו או נבדקו בידי אדם, מה שאומר שהזיות, שגיאות היגיון ואי דיוקים עובדתיים נכנסו ישירות לתוך הטקסט. אם אתם בונים מודל שדורש עובדתיות גבוהה, אי אפשר להסתמך על החומר הזה בעיניים עצומות.

שאלות
נפוצות

האם יש בדאטהסט טקסטים בעברית?

לא. הדאטהסט מבוסס על תת קבוצה מתוך RefinedWeb ומכיל נתונים באנגלית בלבד. אם אתם מאמנים מודל שמיועד לעברית, תצטרכו להביא מקורות נפרדים לחלוטין.

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. הרישיון המדווח הוא odc-by, שמאפשר שימוש מסחרי ומחקר חופשי. התנאי המרכזי הוא מתן קרדיט וייחוס ברור ליוצרי המאגר.

איך נוצרו זוגות ההוראות והתשובות?

החוקרים השתמשו במודל ייעודי שהם אימנו ליצירת הוראות מתוך הקשר קיים. המודל קרא קטעי טקסט מתוך RefinedWeb וייצר עבורם שאלות, משימות ותשובות מתאימות באופן אוטומטי.

במה הוא שונה מדאטהסט רגיל של אימון הוראות?

המאגר הזה לא נועד לכוונון עדין של מודל קיים, אלא נבנה בהיקף עצום של 200 מיליון זוגות עבור שלב האימון המקדים. המטרה היא להקנות למודל הבסיס הבנה של מבנה משימות כבר מהצעד הראשון.

איך טוענים

אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה דרך Hugging Face Hub או גיט. העבודה איתו דורשת את הקוד ממאגר הגיטהאב LMOps של מיקרוסופט כדי להמיר את הדוגמאות לתבנית המתאימה לאימון מקדים. המאגר מורכב ממעל 8,000 קבצים, כולל קובצי json וקובצי txt מחולקים, ולכן צריך לקחת בחשבון נפח אחסון וזמני הורדה משמעותיים.

from datasets import load_dataset

ds = load_dataset("instruction-pretrain/general-instruction-augmented-corpora")

הרישיון

הרישיון המדווח הוא odc-by. מותר להשתמש בנתונים לצרכים מסחריים ומחקריים, כל עוד נותנים ייחוס מתאים ליוצרים המקוריים לפי תנאי הרישיון. הוא אינו דורש שיתוף תחת אותו רישיון, כך שניתן לשלב את הנתונים באימון מודלים קנייניים.

הרישיון המלא ב־Hugging Face ↗