GPT
A

alpaca-cleaned

קוד פתוח

yahmacc-by-4.02023-03-24

  • instruction-finetuning

גרסה מתוקנת של מאגר ההוראות המפורסם מסטנפורד שנועדה לאימון מודלים על מילוי פקודות. היא מתקנת שגיאות גסות, הזיות ופלט ריק שהיו במקור הסינתטי.

  • 24,561הורדות בחודש
  • 877לייקים

מה זה

המאגר מבוסס על Alpaca המקורי של סטנפורד, שכלל 52,000 דוגמאות שנוצרו על ידי המודל text-davinci-003 של OpenAI בשיטת Self-Instruct בעלות נמוכה מ־500 דולר. כל רשומה כוללת משימה, הקשר אופציונלי שקיים בכ־40 אחוז מהמקרים, ותשובה שהמודל ייצר. יש גם שדה טקסט שמחבר את כולם לפורמט הפרומפט המלא ששימש לכוונון.

היוצרים של המאגר הנוכחי זיהו בעיות קשות בדאטה המקורי וניקו אותו. הם תיקנו הזיות שנבעו מהפניות למידע מהאינטרנט, פיצלו הוראות שהתמזגו בטעות לרשומה אחת, מחקו פלטים ריקים, טיפלו בבקשות לייצור תמונות שהמודל לא יכל לבצע, וייבשו תווים בעייתיים. בנוסף הם תיקנו תשובות שגויות, כולל הערכה שבמקור לכ־80 אחוז מבעיות המתמטיקה היו תוצאות שגויות, ואחידו ערכים שונים שציינו שאין קלט.

מתאים ל

  • כוונון מודלי שפה להוראות

    אימון מודל בסיס באנגלית להבנת פקודות ישירות ומענה למשימות שונות ללא צורך בהנדסת פרומפטים מורכבת.

  • מחקר על דאטה סינתטי

    הערכה של השפעת סינון שגיאות והזיות ממאגרי הוראות שנוצרו על ידי בינה מלאכותית לעומת המקור הלא מסונן.

  • אימון מודלי קוד וטקסט קלים

    שיפור ביצועי מודלים קטנים במשימות יצירת טקסט בסיסיות, מיון פריטים ופתרון בעיות באנגלית.

איפה זה נופל

כל הנתונים הם באנגלית בלבד ויוצרו באופן סינתטי על ידי text-davinci-003, כך שהם סוחבים איתם את ההטיות והשגיאות של המודל הזה מתחילת 2023. למרות הניקוי, הכרטיס מודה שנותרו הוראות לא לחלוטין ברורות שלא שוכתבו אם המשמעות שלהן ניתנת להסקה. אם אתם בונים מערכת מדויקת, עדיין תצטרכו לבדוק את איכות התשובות בעצמכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא כדאי להסתמך על זה. המטא-דאטה מציג רישיון חופשי cc-by-4.0, אך בתוך התיאור נכתב במפורש שהרישיון הוא CC BY-NC 4.0 שאוסר שימוש מסחרי. מעבר לכך, הנתונים הופקו ממודל של OpenAI, מה שמוסיף מגבלות שימוש חיצוניות.

האם המאגר מתאים לפרויקטים בעברית?

המאגר מכיל נתונים באנגלית בלבד. אם תרצו להשתמש בו למודל בעברית, תצטרכו לתרגם את כל 52,000 הרשומות בעצמכם. אימון ישיר עליו לא יתרום ליכולות השפה העברית של המודל.

מה ההבדל בינו לבין Alpaca המקורי מסטנפורד?

המאגר המקורי סבל מכמות גדולה של הזיות, פלטים ריקים ודוגמאות קוד חסרות. בנוסף, כ־80 אחוז מבעיות המתמטיקה במקור הכילו שגיאות חישוב. הגרסה הזו עברה סינון ידני וחצי-אוטומטי שתיקן או מחק את הדוגמאות הפגומות.

איך אספו את המידע הזה במקור?

החוקרים מסטנפורד השתמשו בשיטת Self-Instruct עם פרומפט ייעודי שהופעל על המודל text-davinci-003 של OpenAI. הם ייצרו קבוצות של 20 הוראות בכל קריאה כדי לחסוך עלויות, וכל תהליך הפקת 52,000 הדוגמאות עלה פחות מ־500 דולר.

איך טוענים

הנתונים יושבים בקובץ alpaca_data_cleaned.json וכוללים פיצול יחיד של 52,002 שורות אימון. המאגר פתוח לגמרי, אין צורך בבקשת גישה או אישור מיוחד. השדות המרכזיים לעבודה הם instruction למשימה, input להקשר הנוסף, ו־output לתשובה הרצויה. מודלים מסוימים יכולים לקרוא ישירות את שדה text שמכיל כבר את הפורמט המלא לאימון.

from datasets import load_dataset

ds = load_dataset("yahma/alpaca-cleaned")

הרישיון

יש פה סתירה שצריך להכיר. בעמוד המאגר מדווח רישיון cc-by-4.0 שמתיר שימוש מסחרי עם מתן קרדיט, אבל בטקסט התיאור מצוין שהמאגר זמין תחת CC BY-NC 4.0 שאוסר שימוש מסחרי, בהתאם לדאטה המקורי של סטנפורד. בנוסף הנתונים נוצרו באמצעות מודל של OpenAI. שימוש במודל שאומן על המאגר לצרכים מסחריים כרוך בסיכון משפטי ברור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗