GPT
W

WizardLM_evol_instruct_V2_196k

קוד פתוח

WizardLMTeammit2023-06-15

המאגר מכיל דאטה סינתטי שעבר שכלול בשיטת Evol-Instruct ונועד לאימון מודלים על הוראות מורכבות. הוא מתאים למי שרוצה לשפר יכולות שיחה ומענה על משימות בלי לאסוף דוגמאות מאפס.

  • 5,198הורדות בחודש
  • 251לייקים

מה זה

המאגר כולל 143 אלף רשומות המבוססות על שילוב של Alpaca ושיחות מתוך ShareGPT שעברו תהליך שכתוב והרחבה כדי להעלות את רמת הקושי והעומק של ההוראות. המבנה עצמו מיועד לשמש כגרסה מעודכנת עבור סדרת WizardLM, אך הוא אינו שלם כפי שהוא מוגש.

כדי לקבל את הגרסה המלאה של 196 אלף רשומות, המפתחים דורשים להוריד בנפרד מאגר חיצוני של ShareGPT ולאחד אותו עם הקובץ המקומי. הסיבה לחלוקה הזו נובעת ממגבלות רישוי שחלות על שיחות המקור, כך שהקובץ כאן מכיל רק את החלק שעובד ישירות על ידם.

מתאים ל

  • אימון מודלי שיחה

    כוונון עדין של מודלים כדי שידעו להתמודד עם פקודות מורכבות ורב שלביות.

  • שיפור ביצועי מענה

    שימוש ב־143 אלף הדוגמאות המשוכללות להעלאת רמת הפירוט של מודל קיים.

  • מחקר על דאטה סינתטי

    ניתוח ההשפעה של שיטת Evol-Instruct על איכות הפלט ביחס לנתוני מקור רגילים.

איפה זה נופל

הכרטיס כמעט לא מספק תיעוד על סינון תוכן, בטיחות או חלוקה לשפות, אך מכיוון שהוא מבוסס על Alpaca ו־ShareGPT, המיקוד הוא כמעט לחלוטין באנגלית. אין כאן מידע על תמיכה בעברית. בנוסף, הנתונים נוצרו באמצע 2023 ומבוססים על פלטים של מודלי שפה מסחריים מהתקופה ההיא, כך שהם עלולים לשמר שגיאות, הזיות והטיות שמקורן במודלים שיצרו אותם.

אותה משפחה

WizardLM-evol יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

התיעוד אינו מציין קיומה של עברית. המקורות המרכזיים הם Alpaca ו־ShareGPT, שהם מאגרים באנגלית, ולכן לא כדאי להסתמך עליו לצורך אימון מודל לעברית.

למה השם כולל 196k אבל הקובץ מכיל 143k?

בגלל מגבלות רישוי של נתוני השיחות המקוריים, היוצרים העלו רק את 143 אלף הרשומות שהם עיבדו. כדי להגיע ל־196 אלף המלאים, צריך להוריד בנפרד את ShareGPT ולאחד בין הקבצים.

האם מותר להשתמש בזה למוצר מסחרי?

הרישיון הרשמי בעמוד הוא MIT, שמתיר שימוש מסחרי ללא מגבלות מיוחדות. למרות זאת, הנתונים נוצרו באמצעות מודלים כמו ChatGPT, שתנאי השימוש שלהם אוסרים על אימון מודלים מתחרים, ולכן יש כאן סיכון משפטי.

באיזה פורמט המידע שמור?

המידע שמור בקובץ JSON פשוט. אפשר לטעון אותו בקלות באמצעות קוד פייתון או דרך ספריית datasets.

איך טוענים

הנתונים מגיעים בקובץ JSON יחיד בשם WizardLM_evol_instruct_V2_143k.json. המאגר פתוח לחלוטין להורדה ישירה ללא צורך בהרשמה או אישור גישה מראש. לפני שמתחילים באימון, צריך לקחת בחשבון את פעולת המיזוג הידנית עם מאגר ShareGPT החיצוני כדי להגיע לנפח המלא של 196 אלף הדוגמאות, או להסתפק ב־143 אלף הדוגמאות שבקובץ הקיים.

from datasets import load_dataset

ds = load_dataset("WizardLMTeam/WizardLM_evol_instruct_V2_196k")

הרישיון

המאגר מסומן ברישיון MIT, מה שמתיר שימוש חופשי, שינוי והפצה, כולל שימוש מסחרי, תחת מתן קרדיט בלבד. עם זאת, התלות בנתוני ShareGPT ובפלט של מודלים סגורים עלולה להתנגש עם תנאי השימוש של ספקי המקור. מי שמאמן מודל מסחרי צריך לקחת זאת בחשבון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗