GPT
A

alpaca

קוד פתוח

tatsu-labcc-by-nc-4.02023-03-13

  • instruction-finetuning

המאגר כולל 52 אלף הוראות ודוגמאות שנוצרו במודל סגור, והוא מיועד לאימון מודלים פתוחים על מילוי פקודות. הוא מתאים למי שרוצה בסיס מוכן וזול למחקר, בלי להפיק הכל לבד.

  • 122,321הורדות בחודש
  • 1,107לייקים

מה זה

המאגר מכיל 52,002 דוגמאות אימון שנועדו ללמד מודלי שפה לעקוב אחרי הוראות של משתמשים. החוקרים השתמשו בשיטת Self-Instruct עם המנוע text-davinci-003 של OpenAI, אבל פישטו את התהליך כדי לחתוך עלויות. הם ייצרו עשרים הוראות בכל פנייה במקום אחת, ויתרו על ההפרדה בין משימות סיווג למשימות אחרות, והפיקו דוגמה יחידה לכל הוראה במקום שתיים או שלוש. כל הריצה הזו עלתה להם פחות מ־500 דולר.

כל רשומה מורכבת מהוראה ייחודית, קלט אופציונלי שקיים בכארבעים אחוז מהמקרים, ותשובה שנוצרה על ידי המנוע של OpenAI. בנוסף, יש שדה טקסט שמחבר את כולם יחד לתוך תבנית פרומפט מוכנה מראש ששימשה לכוונון עדין. אין כאן חלוקה לסט בדיקה או ולידציה, אלא רק קובץ אימון יחיד.

מתאים ל

  • אימון הוראות למחקר

    כוונון מודלי שפה פתוחים על משימות כלליות באנגלית כדי לבחון יכולות ביצוע.

  • בדיקת שיטות זיקוק

    מחקר על העברת יכולות ממודל גדול של OpenAI למודלים קטנים ומקומיים.

  • ניתוח כשלי מודלים

    זיהוי הטיות, הזיות ושגיאות שנוצרות בעת ייצור דאטה סינתטי באמצעות מנוע חיצוני.

איפה זה נופל

הנתונים כולם נוצרו במרץ 2023 באמצעות מודל ישן יחסית, text-davinci-003, ולא נבדקו ידנית על ידי בני אדם. החוקרים עצמם מודים שהפלט כולל שגיאות והטיות מובנות של אותו מודל, ולכן לא הייתי מכניס אותו לתהליך עבודה בלי סינון או בדיקה מקדימה. בנוסף, כל המאגר נכתב באנגלית בלבד. מי שבונה מודל לעברית או מנסה להבין איך המודל מתמודד עם שפות אחרות לא ימצא כאן שום מענה, ותצטרכו לתרגם את הנתונים בעצמכם או להשתמש במקור אחר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, שמגביל את השימוש למטרות לא מסחריות בלבד. כל מוצר, שירות בתשלום או כלי עסקי שנשען על הנתונים האלה מפר את תנאי הרישיון.

האם יש במאגר נתונים בעברית?

לא, כל 52 אלף הדוגמאות נוצרו באנגלית בלבד. אם אתם צריכים לאמן מודל שיבין עברית, המאגר הזה לא רלוונטי ללא תרגום מקדים.

איך הנתונים האלה נאספו?

החוקרים השתמשו בשיטת Self-Instruct מול המודל text-davinci-003 של OpenAI. הם שלחו פרומפטים מותאמים וייצרו קבוצות של עשרים הוראות בכל פעם כדי להוזיל את עלויות ההפקה.

איך טוענים

המאגר שמור כקובץ פרקט יחיד, כך שההורדה שלו ישירה, מהירה ואינה דורשת אישור גישה מיוחד או חתימה על טפסים. אפשר לטעון אותו בקלות דרך ספריית הדאטהסטים הרגילה ולקבל מיד את כל 52,002 השורות למחשב המקומי. השדות המרכזיים שצריך לשים לב אליהם הם instruction ו־output, יחד עם שדה ה־input שלעיתים נשאר ריק בהתאם לאופי המשימה. אם אתם רוצים לחסוך עבודה על שרשור מחרוזות, שדה ה־text כבר כולל את התבנית המלאה עם המפרידים שהחוקרים השתמשו בהם לאימון.

from datasets import load_dataset

ds = load_dataset("tatsu-lab/alpaca")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC 4.0, מה שאומר שהוא אסור לחלוטין לכל שימוש מסחרי. אתם חייבים לתת קרדיט ליוצרים, ומודל שתאמנו עליו מוגבל למחקר בלבד. אסור למכור גישה למודל כזה או להציע אותו כשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗