GPT
M

Magpie-Qwen2-Pro-200K-Chinese

קוד פתוח

Magpie-Alignרישיון לא דווח2024-06-25

מאגר שיחות סינתטי בסינית שנוצר ישירות מהמודל Qwen2 72B Instruct. הוא מיועד למי שרוצה לאמן מודלים בעזרת פקודות ותשובות ארוכות שכבר עברו סינון איכות ובטיחות.

  • 1,582הורדות בחודש
  • 84לייקים

מה זה

המאגר כולל מאתיים אלף שיחות שנוצרו בשיטת Magpie, המנצלת את מבנה התבנית של המודל כדי לייצר הן את שאלת המשתמש והן את התשובה. כל הנתונים מגיעים ישירות מריצות של המודל Qwen2 72B Instruct, ללא התערבות ידנית של כותבים אנושיים.

רשומות המאגר מכילות מדדים שחושבו עבור כל שיחה, כמו רמת קושי, איכות הקלט, קטגוריית המשימה, אורך בתווים וציון ממודל תגמול. תהליך הסינון שבוצע בחר מתוך מאגר גולמי גדול יותר רק פקודות ברמת איכות ממוצעת ומעלה, עם ציון תגמול של מינוס עשר ומעלה, הסיר כפילויות ומשפטים שנקטעו, ולקח את מאתיים אלף הדוגמאות בעלות התשובות הארוכות ביותר.

מתאים ל

  • אימון SFT בסינית

    כוונון עדין של מודלי שפה למענה על שאלות והוראות מורכבות בסינית על בסיס תשובות ארוכות ומפורטות.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של נתוני אימון שנוצרו ללא מגע יד אדם בהשוואה לנתונים שנאספו ממשתמשים אמיתיים.

  • בחינת מודלי תגמול

    שימוש בציוני האיכות והתגמול הקיימים ברשומות כדי לנתח התאמה בין מודלי הערכה שונים.

איפה זה נופל

המאגר כולו בסינית, כך שאין בו תועלת ישירה לפרויקטים בעברית או באנגלית. בנוסף, מדובר בנתונים סינתטיים בלבד שנוצרו על ידי מודל בודד, מה שעלול להוביל להטיות סגנוניות, לחזרתיות בדפוסי החשיבה ולהזיות עובדתיות שהמודל המקורי פלט.

שיטת הסינון התבססה על בחירת התשובות הארוכות ביותר, גישה שלעיתים מעודדת מלל מיותר ומריחת תשובות במקום דיוק תמציתי. חובה לדגום את הנתונים ולוודא שהתשובות אינן כוללות מידע שגוי לפני שמשלבים אותם בתהליך אימון של מודל סופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר לא דווח כלל על ידי היוצרים. ללא הגדרת רישיון רשמית לא ניתן לדעת אם שימוש מסחרי מותר, ולכן זהו סיכון משפטי לא מבוטל לחברות. מומלץ לפנות למפתחים בעמוד הפרויקט לפני שמתבססים עליו.

האם יש בדאטהסט תמיכה בשפה העברית?

לא, המאגר הזה מכיל אך ורק שיחות בסינית. תהליך הסינון שביצעו החוקרים הגדיר במפורש שמירה של טקסטים בשפה זו בלבד. למי שמחפש חומרים בעברית המאגר אינו מתאים.

איך המידע נוצר ונאסף ללא כותבים אנושיים?

הנתונים נוצרו בשיטת Magpie, שמזינה למודל את תבנית השיחה עד לנקודה שבה אמורה להופיע הודעת המשתמש. המודל מייצר בעצמו את השאלה עקב אופיו האוטו-רגרסיבי, ולאחר מכן מייצר גם את התשובה עבורה.

במה הוא שונה מהגרסאות האחרות של Magpie?

הגרסה הזו עברה סינון ממוקד שהשאיר מאתיים אלף דוגמאות בסינית בלבד, מתוך מאגר גולמי גדול בהרבה. בנוסף, הסינון בחר באופן ספציפי את הדוגמאות בעלות התשובות הארוכות ביותר שעברו סף איכות מסוים.

איך טוענים

הנתונים מחולקים לשני קבצי Parquet תחת תיקיית data, ואין צורך בהרשאת גישה מיוחדת כדי להוריד אותם מספריית Hugging Face. הטעינה מתבצעת ישירות בקוד באמצעות הפונקציה load_dataset הרגילה של הספרייה.

בעת עיבוד הנתונים כדאי לשים לב לשדות התיוג הנלווים, במיוחד סיווגי הבטיחות של Meta Llama Guard 2, שמאפשרים לבצע סינון מחמיר יותר לפני שמתחילים את שלב האימון בפועל.

from datasets import load_dataset

ds = load_dataset("Magpie-Align/Magpie-Qwen2-Pro-200K-Chinese")

הרישיון

היוצרים לא דיווחו על רישיון בדף המאגר. במצב כזה אין אישור שימוש מוגדר, ומשפטית מדובר בסיכון עבור פרויקטים מסחריים או מוצרים שיוצאים לציבור. אם אתם שוקלים להשתמש בו לאימון מודל שאינו למטרות מחקר פנימי, יש לברר מראש מול צוות הפרויקט את תנאי השימוש ולוודא גם את תנאי הרישיון של מודל המקור Qwen2.

הרישיון המלא ב־Hugging Face ↗