GPT
A

alpaca-gpt4

קוד פתוח

vicgallecc-by-nc-4.02023-04-07

  • gpt4
  • alpaca
  • instruction-finetuning
  • synthetic

המאגר כולל הוראות מעקב באנגלית שנוצרו על ידי GPT-4 על בסיס הפרומפטים של אלפקה. הוא מיועד למי שרוצה לאמן מודל שפה על תשובות מפורטות ואיכותיות יותר מאלה של הדור הקודם.

  • 4,434הורדות בחודש
  • 326לייקים

מה זה

המאגר מכיל 52,000 רשומות ייחודיות של הוראות מעקב לצורך אימון מודלים. המבנה מבוסס על מערך הנתונים המקורי של אלפקה, אך במקום להשתמש במודל text-davinci-003, התשובות כאן הופקו ישירות על ידי GPT-4. החוקרים לקחו את אותם הפרומפטים במטרה לקבל פלטים ארוכים ומדויקים יותר, ומדובר במעטפת שנועדה להתאים את הנתונים לעבודה נוחה עם ספריית datasets של Hugging Face.

כל שורה במאגר כוללת ארבעה שדות טקסטואליים ברורים. שדה instruction מגדיר את המשימה שעל המודל לבצע, שדה input מכיל הקשר נוסף במידת הצורך, שדה output מציג את התשובה שסיפק GPT-4, ושדה text מחבר את כל החלקים יחד עם התבנית המקורית של אלפקה לצורך הזנה ישירה למודל.

מתאים ל

  • אימון הוראות ראשוני

    כוונון עדין של מודלי קוד פתוח כדי שילמדו לענות נכון ובפירוט להנחיות באנגלית.

  • מחקר על דאטה סינתטי

    השוואת ביצועים בין מודלים שאומנו על דורות שונים של מודלי מקור.

  • בדיקת מבנה פרומפטים

    הערכת היכולת של מודל קטן לעקוב אחרי הקשרים מורכבים בשדה קלט ייעודי.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, ואין בו שום תוכן בעברית או ייצוג לשפות אחרות. הנתונים פורסמו באפריל 2023, והם מבוססים על דור מוקדם של GPT-4 בלי עדכונים מאוחרים יותר. בנוסף, מדובר בטקסט סינתטי לחלוטין שנפלט ממודל, כך שהוא עלול לכלול הזיות, חזרתיות טיפוסית למודלי שפה והטיות שמקורן באימון של OpenAI. אי אפשר להסתמך עליו לבדיקות איכות אמיתיות בעולם האמיתי בלי סינון ידני.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא, הרישיון הוא CC BY-NC 4.0 שמגביל את השימוש למטרות לא מסחריות בלבד. אם אתם מתכננים לבנות מודל לחברה או למכור שירות, תצטרכו לחפש מקור נתונים אחר.

מה ההבדל בינו לבין אלפקה המקורי?

אלפקה המקורי השתמש במודל text-davinci-003 כדי לייצר את התשובות לפרומפטים. כאן השתמשו באותן הוראות בדיוק, אבל הריצו אותן מול GPT-4, מה שהניב פלטים ארוכים ומפורטים יותר.

האם יש במאגר תמיכה בעברית?

לא, כל 52,000 ההוראות והתשובות במאגר כתובות באנגלית בלבד. כדי לאמן בעברית תצטרכו לתרגם את הנתונים או להשתמש במאגר ייעודי אחר.

האם צריך לבקש גישה מיוחדת להורדה?

אין צורך בשום אישור, המאגר פתוח לחלוטין להורדה ישירה דרך Hugging Face. הוא מגיע בקובץ parquet יחיד שנטען תוך שניות בודדות.

איך טוענים

אתם מושכים את המאגר ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך בהרשמה מיוחדת או באישור גישה. כל המידע יושב בקובץ parquet יחיד שנמצא בתיקיית הנתונים לצד קובץ התיעוד, כך שהטעינה שלו לסביבת העבודה מהירה מאוד. אין פה חלוקה מובנית לחלקי אימון ומבחן, אלא קובץ אימון בודד שמכיל את כל 52,000 הדוגמאות. בזמן עיבוד הנתונים כדאי להחליט מראש אם משתמשים בשדה text המוכן שמשרשר את הפרומפט, או בונים תבנית משלכם מתוך שדות instruction, input ו־output כדי לשלוט בעימוד המדויק.

from datasets import load_dataset

ds = load_dataset("vicgalle/alpaca-gpt4")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC 4.0, מה שאומר שמותר להשתמש בו אך ורק למטרות מחקר ושימוש לא מסחרי. חובה לתת קרדיט ליוצרים המקוריים, ואסור לשלב אותו באימון מודלים שמיועדים למוצרים מסחריים או לשירותים בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗