GPT
T

The-Tome

קוד פתוח

arcee-aimit2024-07-22

אוסף של 1.75 מיליון הוראות שנבחר וסונן כדי לאמן מודלים על מעקב אחרי פקודות. הוא משלב תשעה מקורות שונים שעברו דירוג איכות וערך לימודי.

  • 233הורדות בחודש
  • 110לייקים

מה זה

המאגר מאגד 1.75 מיליון דוגמאות שנאספו מתשעה מאגרי מידע ציבוריים שונים, ביניהם airoboros, מקורות של שיחות מערכת, קריאות לפונקציות, חשיבה מבוססת קוד ונתונים מבוססי Magpie. המטרה היתה ליצור בסיס אימון חזק למעקב אחר הוראות, והוא שימש במקור לפיתוח מודלי Nova ו־Spark של Arcee AI לפני שמוזגו עם Qwen2.

תהליך הסינון התמקד בעיקר במאגרים הגדולים Infini-Instruct ו־WebInstruct. החוקרים הפעילו מודל reranker ייעודי שבדק את רמת ההיענות להוראות, לצד מסווג הערך הלימודי של fineweb-edu. שני הציונים האלה שוקללו יחד כדי לסנן החוצה דוגמאות חלשות ולהשאיר את חצי המיליון המובילים מכל אחד משני המקורות האלה, בנוסף לשאר הנתונים שנלקחו כמו שהם בפורמט ShareGPT.

מתאים ל

  • אימון הוראות למודלי שפה

    שימוש ב־1.75 מיליון הדוגמאות המסוננות לביצוע fine-tuning של מודל בסיס לשיפור תגובה להוראות.

  • לימוד קריאה לפונקציות

    אימון רכיבי כלים וקריאות מערכת באמצעות הדוגמאות הייעודיות שנלקחו ממאגר glaive המוטמע בפנים.

  • שיפור יכולות חשיבה וקוד

    חילוץ תתי המאגרים של reasoning ו־self-instruct לצורך אימון ממוקד על פתרון בעיות מורכבות.

איפה זה נופל

המאגר מבוסס כולו על אנגלית, כפי שמעיד מקור כמו magpie-en ושאר הדאטהסטים המערביים, כך שאין כאן שום כיסוי לעברית. בנוסף, הוא נשען בכבדות על נתונים סינתטיים ופלט של מודלים אחרים, מה שמביא איתו את ההטיות הרגילות של מודלי שפה מסחריים וסיכון להזיות. סינון האיכות באמצעות fineweb-edu הופעל רק על שני מקורות מתוך התשעה, ולכן חלקים אחרים במאגר עלולים להכיל מידע לא עקבי או קוד שלא נבדק.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט למוצר מסחרי?

כן, הרישיון המוגדר במאגר הוא MIT. אפשר לאמן עליו מודלים מסחריים ולשלב אותם בכל מוצר, כל עוד שומרים על תנאי הייחוס הבסיסיים של הרישיון.

האם יש במאגר דוגמאות בעברית?

לא, הנתונים כולם באנגלית. המקורות שנאספו, כולל WebInstruct ו־magpie-en, מיועדים למודלים דוברי אנגלית בלבד ולא יתרמו לאימון עברית.

איך החוקרים סיננו את הנתונים?

הם השתמשו במדרג ייעודי למעקב אחר הוראות ובמסווג של fineweb-edu על שני המאגרים המרכזיים. שקלול הציונים קבע אילו דוגמאות יכנסו לגרסה הסופית.

באיזה פורמט המידע שמור?

המידע שמור בקובץ the_tome.jsonl. חלקים גדולים ממנו נלקחו במקור ממבנה ShareGPT שמייצג שיחות מרובות שלבים והוראות מערכת.

איך טוענים

הנתונים יושבים בקובץ jsonl בשם the_tome.jsonl בתוך המאגר. אין צורך לבקש אישור גישה מיוחד, אפשר פשוט למשוך אותו עם ספריית datasets או להוריד ישירות את הקובץ. בהתחשב בכך שיש כאן כמעט שני מיליון רשומות מרובות תורות, כדאי להיערך עם נפח אחסון פנוי וזיכרון מתאים לעיבוד קבצי טקסט גדולים לפני שמתחילים להזין אותו לתהליך האימון.

from datasets import load_dataset

ds = load_dataset("arcee-ai/The-Tome")

הרישיון

המאגר מופץ ברישיון MIT, שזה הרישיון הכי פתוח שיש. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים פנימיים או פתוחים, ולהפיץ הלאה בלי חובת שיתוף באותו רישיון. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים של היוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗