GPT
M

magpie-ultra-v1.0

קוד פתוח

argillaרישיון לא דווח2024-09-20

  • synthetic
  • distilabel
  • rlaif

שיחות רב שלביות סינתטיות שנוצרו ישירות מתוך Llama 3.1 405B. המטרה כאן היא אימון הוראות מורכב בלי לגעת במידע שנאסף ממשתמשים בשר ודם.

  • 7,070הורדות בחודש
  • 52לייקים

מה זה

כל הרשומות נוצרו באמצעות שיטת Magpie, שבה מודל Llama 3.1 405B מייצר בעצמו הן את בקשת המשתמש והן את התשובה על בסיס תבנית הפרומפט המובנית שלו. התהליך חוזר על עצמו שלוש פעמים בכל דגימה כדי לבנות שיחה מלאה של שלושה שלבים. המשימות מכסות תחומים מגוונים כמו תכנות, ניפוי שגיאות, מתמטיקה, ניתוח נתונים וכתיבה יצירתית.

הסינון והבקרה נשענים על כמה מודלים נוספים. Llama 3.1 8B מתייג את רמת הקושי, האיכות ותחום המשימה, Llama Guard 3 מסווג בטיחות לפי תקני MLCommons, והמודל ArmoRM מעניק ציון איכות לכל שיחה. בנוסף, אמבדינגס של gte-large-en וחיפוש Faiss שימשו לבדיקת מגוון ההוראות.

המאגר מחולק לחמישה תתי מאגרים. ברירת המחדל מכילה מיליון שיחות גולמיות ללא סינון, ולצידה קיימות ארבע גרסאות מסוננות ומדורגות: שתי גרסאות של שיחות ארוכות בנפחים של 300 אלף ו־500 אלף, ושתי גרסאות מקבילות של שיחות קצרות.

מתאים ל

  • אימון הוראות מתקדם

    כיוונון עדין למודלים פתוחים על שיחות מורכבות של שלושה שלבים בתכנות, מתמטיקה וניתוח נתונים.

  • סינון לפי איכות ובטיחות

    שימוש בדירוגי ArmoRM ו־Llama Guard המצורפים לכל שורה כדי לבנות דאטהסטים נקיים וממוקדים.

  • מחקר על דאטה סינתטי

    בדיקת איכות התוצרים של שיטת Magpie והשוואה בין שיחות קצרות לארוכות תחת אותו מקור הפקה.

איפה זה נופל

היוצרים מודים שבלי פרומפטים מנחים ייעודיים לכל קטגוריה, מודל Llama 3.1 405B נוטה לייצר כמעט אך ורק שאלות במתמטיקה, מה שמייצר הטיה ברורה באופי השאלות הגולמיות. כל המידע סינתטי לחלוטין ונשען על הידע וההזיות של מודלי Llama, ללא אימות אנושי. בנוסף, מודל האמבדינגס ששימש למדידת המגוון מיועד לאנגלית בלבד, ואין בדאטהסט התייחסות לשפות אחרות או לעברית.

אותה משפחה

magpie-ultra יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי לא צוין בכרטיס המאגר, מה שיוצר סיכון משפטי ברור. בנוסף, הנתונים הופקו באמצעות Llama 3.1 405B, ולכן חלים עליהם תנאי השימוש והמגבלות של מטא לגבי שימוש בתוצרי המודל לאימון מודלים מתחרים.

האם הדאטהסט כולל תוכן בעברית?

המאגר מבוסס כולו על אנגלית. תהליך הסינון, בדיקת המגוון וסיווג הבטיחות התבססו על מודלים שמיועדים לאנגלית, ואין עדות לנתונים בשפות אחרות.

במה הגרסה הזו שונה מגרסה v0.1 שפורסמה בעבר?

לפי היוצרים, גרסה זו גדולה פי עשרים מהגרסה הקודמת. היא מציגה מגוון רחב יותר של הנחיות וכוללת שיחות מרובות שלבים באורך של שלושה סבבים במקום אינטראקציות בודדות.

איזה תת מאגר כדאי לטעון בהתחלה?

עדיף להתחיל עם תת המאגר המסונן של 300 אלף שיחות ארוכות או קצרות ולא עם מאגר ברירת המחדל. מאגר ברירת המחדל מכיל מיליון דוגמאות גולמיות ללא סינון איכות, בעוד שהתת מאגרים עברו דירוג וסינון בטיחות.

איך טוענים

הנתונים מחולקים ל־97 קבצים במאגר, כולל 56 קבצי Parquet בחלק האימון, כך שמומלץ לטעון תת מאגר ספציפי דרך Hugging Face במקום למשוך את כל מיליון הרשומות יחד. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה. השדות המרכזיים כוללים את תוכן השיחה עצמה, פרומפטים גולמיים, וכן את הדירוגים המבניים שנוצרו לגבי כוונת המשתמש, רמת הקושי והבטיחות.

from datasets import load_dataset

ds = load_dataset("argilla/magpie-ultra-v1.0")

הרישיון

הרישיון של המאגר לא דווח כלל בעמוד המודל. מצב כזה משאיר סימן שאלה משפטי גדול, שכן הנתונים נוצרו ישירות ממשפחת Llama 3.1 של מטא, הכפופה לרישיון קהילתי מגביל. בלי הבהרה רשמית מהיוצרים, לא מומלץ להשתמש בנתונים האלה לאימון מודל המיועד למוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗