GPT
T

tulu-v2-sft-mixture

קוד פתוח

allenaiodc-by2023-11-13

תערובת נתונים מגוונת לאימון מודלים כעוזרים אישיים. היא מרכזת מעל 300 אלף דוגמאות איכותיות ממקורות מובילים כמו שרבוב שיחות ופתרון בעיות בשלבים.

  • 5,873הורדות בחודש
  • 138לייקים

מה זה

המאגר מכיל פיצול יחיד של נתוני אימון שנועדו להוראות ולשיחה. הוא מרכז דגימות מכמה מקורות מוכרים: 50,000 דוגמאות מתוך פלאן ועוד 50,000 מתת קבוצת שרשרת המחשבה שלו, 114,046 משיחות מעובדות של שר ג'יפיטי, וכן 7,708 נתיבים בעלי הציון הגבוה ביותר מתוך עצי השיחה של אופן אסיסטנט 1.

בנוסף, נכללו נתונים מזוקקים ממודלים חזקים: 20,000 דוגמאות של ג'יפיטי 4 אלפקה, 20,022 דוגמאות של קוד אלפקה לחיזוק יכולות תכנות, 30,000 דגימות ג'יפיטי 4 מאופן אורקה, וכן 30,000 מוויזארד אל אם. להשלמת התערובת נוספו 1,030 רשומות מוקפדות מתוך לימה, 7,544 דוגמאות ממשימות הבנת מסמכים מדעיים, וכן 14 ניסוחי שאלות זהות שנכתבו ידנית וחזרו על עצמם 10 פעמים לכדי 140 דוגמאות בסך הכל.

מתאים ל

  • אימון הוראות כללי

    אימון מודל שפה פתוח למענה על שאלות, ביצוע הוראות וניהול שיחה.

  • הסקה ופתרון בעיות

    שיפור יכולות שרשרת מחשבה בזכות 50,000 דוגמאות ייעודיות מפלאן.

  • יכולות קוד בסיסיות

    חיזוק כתיבת קוד באמצעות שילוב 20,022 דוגמאות מתוך קוד אלפקה.

  • הבנת טקסט מדעי

    אימון על 7,544 דוגמאות של סיכום, אימות עובדות וחילוץ מידע מדעי.

איפה זה נופל

כל הנתונים מוגדרים באנגלית בלבד ואין במאגר תמיכה בעברית. חלק מהדוגמאות בקובץ מכילות תורות שיחה ריקים לחלוטין שמחייבים ניקוי עצמאי לפני אימון.

בדאטה המדעי יש שגיאה ידועה באינדקס המשפטים, שלפי המפתחים הייתה בעלת השפעה זניחה אך קיימת. מעבר לכך, חלקים מהותיים מהמאגר הם נתונים סינתטיים שזוקקו ממודלים של אופן איי איי, דבר שמגביל שימוש עצמאי לחברות מסחריות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, זהו מאגר מחקרי. אף שהרישיון הכללי הוא או די סי ביי, חלקים גדולים מתוכו מוגבלים במפורש לשימוש לא מסחרי וכוללים נתונים שזוקקו ממודלים סגורים.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר מסווג ומכיל נתונים באנגלית בלבד. אם המטרה היא התאמה לעברית, תצטרכו לתרגם אותו או לשלב מקורות נוספים.

באיזה פורמט הקבצים מגיעים?

הנתונים מחולקים לשלושה קבצי פארקט תחת פיצול אימון יחיד. אין צורך לבקש הרשאות גישה מיוחדות כדי להוריד אותם.

מה הבעיה הטכנית המרכזית שצריך לשים לב אליה?

הכרטיס מדווח על תורות שיחה ריקים בחלק מהדוגמאות ושגיאת אינדקס בחלק המדעי. יש לסנן את השיחות הריקות בקוד שלכם לפני תחילת האימון.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטס בלי צורך באישור גישה. הנתונים שמורים בשלושה קבצי פארקט ומחולקים לפיצול אימון יחיד.

לפני שמתחילים להריץ, חובה לנקות את הנתונים בקוד שלכם. היוצרים מדווחים שיש בדאטה תורות שיחה ריקים שלא הוסרו כדי לשמור על יכולת שחזור התוצאות, ולכן מומלץ לסנן אותם מראש.

from datasets import load_dataset

ds = load_dataset("allenai/tulu-v2-sft-mixture")

הרישיון

המאגר פורסם רשמית תחת רישיון פתוח של או די סי ביי, אבל בפועל מדובר באוסף מחקרי שמערבב תת מאגרים עם רישיונות שונים לחלוטין. חלקים כמו ג'יפיטי 4 אלפקה, קוד אלפקה ולימה מוגבלים לשימוש לא מסחרי, ובוויזארד אל אם כלל לא סופק רישיון. המשמעות פשוטה: המאגר מיועד למחקר בלבד, ולא מתאים לאימון מודל שאתם מתכננים למכור או להפעיל במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗