GPT
M

Magpie-Pro-300K-Filtered

קוד פתוח

Magpie-Alignllama32024-06-11

המאגר כולל 300,000 הוראות ותשובות שחולצו ישירות מתוך Llama 3 70B Instruct ועברו סינון קפדני. הוא מיועד למי שרוצה לאמן מודל בסיס בלי להשקיע ביצירת דאטה ידנית יקרה.

  • 3,857הורדות בחודש
  • 56לייקים

מה זה

הנתונים נוצרו בשיטה שנקראת Magpie, שמנצלת את מנגנון ההשלמה של Llama 3 כדי לגרום לו לייצר גם את שאלת המשתמש וגם את התשובה שלו. במקור חולצו מיליון שיחות שלמות ישירות מהמודל של 70 מיליארד פרמטרים, ללא שימוש בהנחיות אנושיות מראש.

מתוך המאגר המקורי נבחרו 300,000 רשומות שעמדו ברף איכות מוגדר: איכות קלט מעל הממוצע, ציון תגמול של מינוס 10 ומעלה, והסרה של חזרות והוראות קטועות שמסתיימות בנקודתיים. בנוסף, נבחרו הדוגמאות בעלות התשובות הארוכות ביותר, כדי להבטיח פירוט ועומק בכל אינטראקציה.

מתאים ל

  • אימון הוראות SFT

    כוונון של מודלי בסיס כמו Llama-3-8B-Base כדי להביא אותם לרמת ביצועים של מודל שיחה מלא.

  • השוואת נתוני יישור

    בדיקת ביצועים של דאטה סינתטי מול דאטהסטים מבוססי אדם בבנצ'מרקים כמו AlpacaEval ו־WildBench.

  • ניתוח התנהגות מודל המקור

    מחקר על סוג השאלות וההטיות שמודל Llama 3 מייצר באופן טבעי כשמאפשרים לו להשלים שיחה מאפס.

איפה זה נופל

הכל כאן סינתטי לחלוטין ונשען על מה ש־Llama 3 70B למד, כך שכל הטיה או שגיאה של מודל המקור עוברת הלאה. הסינון לפי אורך התשובות עלול לגרום למודלים שלכם לפתח נטייה למריחת מילים מיותרת. אין בכרטיס פירוט לגבי שפות אחרות או נוכחות של עברית, והאינטראקציות מוגבלות לתור יחיד בלי המשך שיחה.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, אבל רק תחת המגבלות של רישיון llama3. אם המוצר שלכם מבוסס על מודל אחר, הרישיון אוסר על שימוש בפלט לאימון מודל מתחרה.

האם יש במאגר שיחות בעברית?

כרטיס המאגר לא מפרט חלוקה לשפות ולא מציין נוכחות של עברית. מכיוון שהדאטה נוצר על ידי Llama 3 70B, רובו המוחלט באנגלית וייתכנו רק שרידים מזעריים של שפות אחרות.

במה הוא שונה מ־Magpie-Pro-MT-300K?

הגרסה הזו מכילה חילופי דברים של תור אחד בלבד שנבחרו לפי אורך התשובה. גרסת ה־MT מרחיבה שאלות קשות לשיחות מרובות תורות, והיוצרים מציינים במפורש שלא כדאי לאמן על שתיהן יחד.

איך המידע נוצר בלי פרומפטים של בני אדם?

החוקרים הזינו למודל Llama 3 70B את התבנית של הודעת המשתמש והשאירו אותה ריקה. המודל השלים בעצמו את שאלת המשתמש, ואז הפיק את התשובה המתאימה.

איך טוענים

הדאטהסט מפוצל לשלושה קבצי parquet בתיקיית data, וטוענים אותו ישירות דרך הספרייה הרגילה של Hugging Face. אין צורך באישור גישה מיוחד מעבר לקבלה של תנאי llama3. הוא מיועד ישירות לשלב ה־SFT ומכיל שיחות חד-שלביות, כך שמומלץ לבדוק את התאמת תבנית הפרומפטים למודל היעד לפני תחילת הריצה.

from datasets import load_dataset

ds = load_dataset("Magpie-Align/Magpie-Pro-300K-Filtered")

הרישיון

המאגר מופץ תחת רישיון llama3 של חברת מטא. הרישיון מאפשר שימוש מסחרי ומחקר, אך כפוף למגבלות של מטא, כולל איסור על שימוש בפלט לשיפור מודלים מתחרים שאינם מבוססי Llama ומגבלת משתמשים חודשית לחברות ענק. מודל שתאמנו עליו יוגדר כנגזרת ויחייב את אותם התנאים בדיוק.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗