GPT
O

open-perfectblend

קוד פתוח

mlabonneapache-2.02024-10-13

שחזור פתוח של תערובת הוראות מגוונת למודלי שפה, המשלבת שיחה, מתמטיקה וקוד. מי שמאמן מודל בסיס מקבל כאן חבילת נתונים מסוננת ומנופה מכפילויות תחת רישיונות מתירניים.

  • 4,679הורדות בחודש
  • 183לייקים

מה זה

המאגר מרכז דוגמאות מתוך שמונה מקורות שונים בעולם הקוד הפתוח, בהם מאגרי מתמטיקה כמו MetaMathQA ובעיות מילוליות של מיקרוסופט, לצד נתוני שיחה כמו ultrachat וקוד מתוך evol codealpaca. המטרה המוצהרת היא שחזור של תערובת ההוראות מהמאמר The Perfect Blend, כאשר כל הנתונים מגיעים מדאטהסטים שפורסמו ברישיונות חופשיים בלבד.

במהלך ההכנה עברו הנתונים סינון כפילויות שהסיר כמעט 88,100 דוגמאות מכלל המקורות. יש פה גם שתי סטיות מהמאמר המקורי: נתוני הבנת ההוראות הוחלפו במקור חלופי כי מטא לא שחררה את שלה, וקטגוריית הכוונות המזיקות הושמטה לחלוטין מאותה סיבה בדיוק.

מתאים ל

  • כוונון מודלים להוראות

    אימון ראשוני או המשך אימון של מודלי שפה על מגוון נושאים כלליים כמו שיחה, היגיון וכתיבה.

  • חיזוק יכולות מתמטיקה

    שימוש במאות אלפי הדוגמאות הייעודיות כדי לשפר פתרון בעיות חישוביות ומילוליות במודל.

  • שיפור ביצועי קוד

    שילוב דוגמאות הקוד הקיימות במאגר כחלק מתערובת רחבה להבנה ויצירה של תוכנה.

איפה זה נופל

אין כאן סינון של כוונות מזיקות או נתוני בטיחות, כי היוצר בחר פשוט לא לכלול את החלק הזה שהופיע במאמר המקורי. מי שמשתמש בזה כדי לייצר מודל ישירות למשתמשי קצה עלול לקבל תשובות לא בטוחות, אלא אם כן יוסיף שכבת סינון ובטיחות משלו. בנוסף, כל המקורות המדווחים הם באנגלית, כך שאין שום התאמה מובנית לעברית או משימות מקומיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוצהר הוא Apache 2.0 וכל מקורות המידע נלקחו ממאגרים בעלי רישיון דומה או MIT. אפשר לאמן מודלים לשימוש מסחרי, אך נדרש להקפיד על מתן קרדיט כפי שהרישיונות דורשים.

האם הדאטהסט כולל תמיכה או טקסטים בעברית?

לא, המאגרים המרכיבים את התערובת הזו נאספו כולם באנגלית בלבד. אם יש צורך בהתאמה לשוק המקומי או ליכולות שפה בעברית, תצטרכו להוסיף מקורות נתונים מתאימים בנפרד.

מה ההבדל בין המאגר הזה לבין מה שמופיע במאמר המקורי?

היוצר החליף את נתוני מילוי ההוראות במאגר חלופי מכיוון שמטא לא שחררה את הנתונים שלה. בנוסף, כל החלק של התוכן המזיק הוסר לגמרי מהתערובת ולא נכלל כאן.

איך סוננו הנתונים לפני שהועלו?

היוצר ביצע תהליך ניפוי כפילויות שהסיר כ־88,100 דוגמאות מכל המאגרים שנאספו. מעבר לכך לא דווח על מנגנוני סינון איכות ידניים או נוספים מעבר למה שהיה קיים במקורות המקוריים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה מראש. הקבצים יושבים בשישה קובצי parquet נפרדים של אימון, ומדובר בנפח של למעלה ממיליון וחצי רשומות, כך שכדאי להביא בחשבון זמן הורדה ושטח אחסון פנוי בדיסק לפני שמתחילים לפרוק אותם.

הפורמט מבוסס על מבנה שיחות והוראות המוכר מאימוני כוונון, ולכן מומלץ לבדוק את אחידות השדות בכל רשומה לפני שמזרימים את התוכן לסביבת האימון המקומית.

from datasets import load_dataset

ds = load_dataset("mlabonne/open-perfectblend")

הרישיון

המאגר מופץ ברישיון Apache 2.0, וכל שמונת המאגרים שהרכיבו אותו מחזיקים ברישיון זהה או ברישיון MIT. המשמעות פשוטה: מותר להשתמש בנתונים לאימון מודלים מסחריים ומחקר, ללא חובת שיתוף של התוצרים באותו רישיון, אך יש לשמור על תנאי הייחוס והקרדיט למקורות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗