GPT
M

magpie-ultra-v0.1

קוד פתוח

argillallama3.12024-07-24

  • synthetic
  • distilabel
  • rlaif

המאגר מרכז זוגות הוראה ותשובה סינתטיים שנבנו עם Llama 3.1 405B כדי לאמן מודלים על משימות מורכבות. פונים אליו כשמחפשים דאטה מסונן ומדורג לאימון SFT בלי לגרד שאלות משתמשים אמיתיות מהרשת.

  • 2,108הורדות בחודש
  • 221לייקים

מה זה

כל רשומה כוללת הנחיה שנוצרה מאפס ותשובות מקבילות ממודל ה־instruct ומגרסת הבסיס של Llama 3.1 405B. לצד הטקסט יש ניקוד איכות של מודל תגמול, הערכות קושי, סיווג בטיחות ווקטור ייצוג מתמטי.

ההוראות הופקו בשיטת Magpie, שבה שולחים למודל תבנית שיחה ריקה ומניחים לו לייצר את שאלת המשתמש בעצמו. לאחר מכן Llama 3.1 8B סיווג את המשימות לתחומים כמו תכנות, מתמטיקה וכתיבה יוצרת, בעוד Llama Guard 3 תייג בעיות בטיחות לפי תקן MLCommons.

התהליך כלל שלב ייצור ראשוני של 50,000 זוגות, בדיקת דמיון וקטורי לשמירה על גיוון, וחישוב פער ציונים מול מודל הבסיס כדי לבודד פלטים איכותיים במיוחד.

מתאים ל

  • אימון SFT באנגלית

    כוונון עדין של מודלי שפה על משימות ניתוח נתונים, פתרון בעיות וכתיבת קוד לפי דוגמאות מורכבות.

  • אימון מודלי DPO

    שימוש בזוגות התשובות ובציוני הדירוג המובנים כדי ללמד מודל להעדיף תשובות מועילות על פני תשובות בסיס.

  • סינון והערכת בטיחות

    בניית מסנני תוכן או בדיקת עמידות של מודלים בהתבסס על הסיווגים של Llama Guard שנכללים בכל שורה.

איפה זה נופל

החומר כולו באנגלית ונוצר כולו על ידי מודלים, כך שהוא נושא את ההטיות, טעויות החישוב והסגנון האופייניים לסדרת Llama. תהליך הסינון האוטומטי על ידי מודלים אחרים לא מחליף בדיקה אנושית, ובגרסה הזו אין שיחות מרובות שלבים אלא רק אינטראקציות בודדות. אם אתם בונים שירות שפונה לקהל מקומי או דורש עברית, אין כאן שום מידע רלוונטי עבורכם. הנתונים מתאימים בעיקר כחומר בסיס כללי באנגלית שדורש בדיקת איכות מדגמית לפני אימון ייעודי.

אותה משפחה

magpie-ultra יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון הוא רישיון הקהילה של Llama 3.1, שמתיר שימוש מסחרי תחת תנאי הסף וההגבלות של מטא. אם המוצר שלכם מגיע להיקפי שימוש חריגים של מאות מיליוני משתמשים בחודש, נדרש רישיון מיוחד ממטא. כמו כן, אסור להשתמש בנתונים האלה כדי לאמן מודלים שנועדו להתחרות ישירות במשפחת Llama.

האם יש כאן נתונים בעברית?

לא. המאגר כולל תוכן בשפה האנגלית בלבד. אם אתם צריכים הנחיות או משימות בעברית, תצטרכו לתרגם את הנתונים באופן עצמאי או לפנות למקורות מידע אחרים.

איך אספו את השאלות אם אין כאן משתמשים אמיתיים?

השתמשו בשיטת Magpie. שלחו למודל ה־405B את התחילית של תבנית ההודעה והוא השלים לבד את שאלת המשתמש, מתוך הידע שצבר באימון המקורי שלו על סגנונות שיחה שונים.

מה ההבדל בין המאגר הזה לגרסאות אחרות של Magpie?

הגרסה הזו היא איטרציה מוקדמת שמבוססת ספציפית על Llama 3.1 405B ומכילה כמות פלטים קטנה יחסית שנועדה לבדיקה. בגרסאות מאוחרות יותר כמו v1.0 הרחיבו את ההיקף למיליון שורות והוסיפו שיחות מרובות תורות במקום שאלות ותשובות בודדות.

איך טוענים

הנתונים יושבים בשני קבצי Parquet תחת תיקיית data, לצד סקריפטים של פייתון כמו pipeline.py ששימשו להרצה. טוענים אותם ישירות דרך ספריית datasets הרגילה בפייתון בעזרת המזהה של המאגר, ללא צורך באישור גישה ידני או מילוי טפסים. שדות המפתח שמעניינים את מי שמאמן הם ההנחיה, הפלטים המושווים, ותגיות הבטיחות והסיווג שמאפשרות לחתוך רק את החומר הרלוונטי.

from datasets import load_dataset

ds = load_dataset("argilla/magpie-ultra-v0.1")

הרישיון

הרישיון מוגדר תחת תנאי השימוש של Llama 3.1. מותר להשתמש בתוכן לפיתוח ומחקר, כולל שימוש מסחרי, כל עוד עומדים במגבלות המקוריות של חברת מטא. שימו לב שהרישיון של מטא אוסר להשתמש בפלט של הדגם כדי לשפר או לאמן מודלים שמתחרים בו ישירות, למעט מודלים שמבוססים על Llama עצמו.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗