GPT
W

Wizard-LM-Chinese-instruct-evol

קוד פתוח

silk-roadcc-by-4.02023-05-15

המאגר מכיל הוראות מורכבות בסינית שמבוססות על WizardLM של מיקרוסופט ותשובות שנוצרו על ידי GPT. הוא מיועד למי שמאמן מודלים לפקודות מורכבות שמתעלות על רמת הקושי של אלפקה.

  • 550הורדות בחודש
  • 98לייקים

מה זה

הנתונים נשענים על פרויקט WizardLM של MSRA. הרעיון היה לקחת הוראות באנגלית שהורחבו בשיטת Evol-Instruct, לתרגם אותן לסינית, ואז להריץ עליהן שאילתות מול GPT כדי לקבל את התשובות הסופיות. זה לא תרגום עיוור של השאלות והתשובות גם יחד, אלא יצירה מחדש של הפלט ישירות מתוך הפרומפט המתורגם.

המאגר שפורסם במאי 2023 מקושר לפרויקט Luotuo, יוזמת קוד פתוח של חוקרים עצמאיים. הקובץ המרכזי שמופיע שם הוא wizard_700k.jsonl, אף על פי שסך הרשומות שמוגדר בפועל במטא-דאטה נע בין עשרת אלפים למאה אלף. הכרטיס לא מפרט חלוקות רשמיות לאימון ומבחן.

מתאים ל

  • אימון מודלים בסינית

    כוונון עדין של מודלי שפה על משימות מורכבות ומענה לשאלות בסינית מודרנית.

  • בדיקת חוסן להזרקות

    איתור כשלים ותרגומים שבורים שנוצרו עקב הזרקת הוראות בזמן עיבוד נתונים.

  • מחקר הוראות מרובות שלבים

    השוואת ביצועים מול דאטהסטים פשוטים יותר כמו אלפקה בבניית סדרות הנחיה מורכבות.

איפה זה נופל

היוצרים עצמם מזהירים שיש כאן בעיה מובנית. חלק מההוראות המקוריות גרמו להזרקות הוראות (prompt injection) בזמן התרגום, מה שהוביל לתרגומים שבורים או שגויים. בנוסף, כל התוכן הסיני נשען על פלטים סינתטיים של מודלי GPT מאמצע 2023, בלי בדיקת איכות אנושית מתועדת. אין כאן אף מילה בעברית, כך שהמאגר שימושי רק למשימות שכוללות סינית או אנגלית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי בעמוד הוא cc-by-4.0 שמתיר שימוש מסחרי עם מתן קרדיט. יחד עם זאת, התשובות הופקו באמצעות מודלים של OpenAI, שאוסרים על שימוש בפלטים שלהם לאימון מודלים מתחרים. אם המטרה היא מסחרית לחלוטין, יש פה סיכון משפטי שצריך לקחת בחשבון.

האם הדאטהסט כולל טקסט בעברית?

לא, אין במאגר עברית בכלל. השפות היחידות שמתועדות בו הן סינית ואנגלית. מי שמחפש לשפר יכולות בעברית לא ימצא כאן מענה.

איך בדיוק נאסף המידע?

היוצרים לקחו את ההוראות מתוך WizardLM של MSRA ותרגמו אותן לסינית. לאחר מכן, הם הזינו את ההוראות המתורגמות ל־GPT כדי לייצר את התשובות מחדש. התהליך היה אוטומטי ולא כלל סינון ידני מקיף.

במה הוא שונה מדאטהסטים סינתטיים אחרים כמו אלפקה?

WizardLM מתבסס על יצירת הוראות ברמת קושי עולה ועמוקה יותר מההוראות הפשוטות שיש באלפקה. בנוסף, הדגש כאן הוא על יצירת תשובות מקוריות בסינית מתוך שאלות מתורגמות, ולא על תרגום ישיר של תשובות שנכתבו במקור לאנגלית.

איך טוענים

אתם מושכים את הקובץ wizard_700k.jsonl ישירות מספריית Hugging Face ללא צורך באישור גישה מוקדם. הפורמט הוא שורות JSON סטנדרטיות, מה שמקל על טעינה בספריות כמו datasets של פייתון. שימו לב שיש לבדוק את מבנה המפתחות בקובץ לפני האימון, בעיקר כדי לוודא היכן יושבות ההוראות והתשובות בסינית לעומת הטקסט המקורי באנגלית.

from datasets import load_dataset

ds = load_dataset("silk-road/Wizard-LM-Chinese-instruct-evol")

הרישיון

המאגר מוגדר תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שאתם נותנים קרדיט מתאים ליוצרים ומקשרים לרישיון. עם זאת, התשובות נוצרו בעזרת GPT של OpenAI. אם אתם מתכוונים לאמן עליו מודל מסחרי, תנאי השימוש של OpenAI עשויים להגביל אימון מודלים מתחרים, מעבר למה שהרישיון החופשי מרשה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗