GPT
W

WizardLM_evol_instruct_70k

קוד פתוח

WizardLMTeammit2023-04-25

מאגר נתוני אימון שנועד ללמד מודלים להתמודד עם הוראות מורכבות. הוא שימש במקור לאימון הדור הראשון של WizardLM על בסיס שיטת שכלול הוראות סינתטית.

  • 3,379הורדות בחודש
  • 198לייקים

מה זה

המאגר מכיל את נתוני האימון המקוריים ששימשו לבניית מודל ההוראות הראשון בסדרה, ומבוסס על קובץ מרכזי בשם alpaca_evol_instruct_70k.json. לפי המבנה המקובל בפרויקט, מדובר בהוראות שעברו תהליך שכלול אלגוריתמי מדורג, במטרה לקחת פרומפטים פשוטים יחסית בסגנון אלפקה ולהפוך אותם למורכבים, מפורטים ומאתגרים יותר מבחינה לוגית.

כרטיס המאגר לא מפרט את הנתונים הטכניים של כל שדה בנפרד, אך מציג את תוצאות המודלים שאומנו עליו מול מבחני ביצועים מקובלים. מדובר במאגר אחוד שמכיל קובץ נתונים אחד ומסמכי תיעוד, ללא חלוקה מפורשת לקבוצות אימון ובדיקה נפרדות בתוך המאגר עצמו, כאשר כל הדוגמאות מיועדות לכוונון עדין של מודלי שפה.

מתאים ל

  • אימון מודל לעקוב אחר הוראות

    כוונון עדין של מודלי בסיס פתוחים כך שיבינו בקשות מורכבות ויחזירו מענה מובנה.

  • הערכת עמידות בהוראות קשות

    בדיקת היכולת של מודלים קיימים להתמודד עם שאלות שנבנו כדי לאתגר מערכות שפה.

  • מחקר על שכלול נתונים סינתטיים

    ניתוח האופן שבו שכתוב אוטומטי של פרומפטים משפיע על איכות התשובות והלמידה.

איפה זה נופל

הכרטיס מציג בעיקר את הצלחות המודלים במבחנים כמו GSM8k או HumanEval, אבל לא חושף כמעט שום מידע על הסינון שבוצע, על תקלות ידועות או על השפות שקיימות בטקסט. רוב הדוגמאות הללו נוצרות באנגלית, כך שאם אתם בונים מערכת שמכוונת לעברית או לשיח מקומי, המאגר הזה כנראה לא ייתן לכם מענה ישיר. מעבר לזה, הנתונים פורסמו באפריל 2023 ומבוססים על יצירה סינתטית, מה שמחייב בדיקת איכות ידנית כדי לוודא שאין הזיות או חזרות מיותרות שעלולות לעבור למודל שלכם.

אותה משפחה

WizardLM-evol יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי של המאגר הוא MIT, והוא מתיר שימוש מסחרי ללא תמלוגים. יחד עם זאת, אם הנתונים נוצרו בעזרת מודלים מסחריים סגורים, תנאי השירות שלהם עשויים להגביל שימוש לצורך אימון מודלים מתחרים. מומלץ לוודא את מקור הדאטה לפני שילוב במערכת מסחרית.

האם המאגר כולל נתונים בעברית?

המאגר מיועד במקור לעבודה באנגלית ואין בו התייחסות לתמיכה בעברית. אפשר לנסות לתרגם אותו עצמאית לצורכי התאמה מקומית, אך הוא לא מתאים כפי שהוא לאימון מודל בעברית. תצטרכו להסתמך על מקורות אחרים עבור שפה מקומית.

מה הפורמט של הקבצים וכמה מקום צריך?

הנתונים מגיעים בקובץ JSON יחיד שמכיל את כל הדוגמאות, לצד קובץ README. לא מדובר בנפח חריג ביחס למאגרי טקסט של עשרות אלפי רשומות, וניתן להוריד ולעבד אותו על מחשב אישי רגיל ללא צורך בחומרה כבדה. הטעינה בפועל נעשית בקלות עם ספריות פייתון סטנדרטיות.

איך טוענים

כדי להתחיל לעבוד מורידים ישירות את הקובץ alpaca_evol_instruct_70k.json מתוך המאגר, או טוענים אותו בספריית datasets של Hugging Face. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין לכל מי שיש לו קישור.

לפני הטעינה צריך לפתוח את קובץ ה־JSON ולבדוק את שמות המפתחות הפנימיים, שבדרך כלל מחזיקים את ההוראה, הקלט והתשובה הרצויה. מכיוון שהנתונים יושבים בקובץ בודד ללא חלוקה מובנית לסט בדיקה, תצטרכו לפצל בעצמכם מדגם לפיזור ולוולידציה לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("WizardLMTeam/WizardLM_evol_instruct_70k")

הרישיון

המאגר מוגדר תחת רישיון MIT, מה שמתיר שימוש חופשי, שינוי, הפצה ושילוב במוצרים מסחריים ללא תשלום, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. עם זאת, אם המודלים שאומנו על הנתונים הללו סומנו ברישיונות מוגבלים, כדאי לבדוק היטב שאין תלות בפלט של מודלים סגורים שמגבילים שימוש מתחרה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗