GPT
A

unsloth/alpaca-cleaned

קוד פתוח

unslothcc-by-4.02025-12-22

  • instruction-finetuning

גרסה מתוקנת של מאגר ההוראות המפורסם מסטנפורד שנועדה לאימון מודלים. הניקוי מסיר הזיות, פלטים ריקים ושגיאות חישוב גסות שהיו במקור.

  • 3,751הורדות בחודש
  • 24לייקים

מה זה

המאגר מכיל 52,002 דוגמאות אימון באנגלית למשימות יצירת טקסט. כל רשומה כוללת הוראה ייחודית, שדה קלט אופציונלי שמופיע בכארבעים אחוז מהמקרים, תשובה שנוצרה על ידי מודל text-davinci-003, ושדה טקסט מלא שמחבר את כולם לפי תבנית הפרומפט המקורית.

המקור מבוסס על שיטת Self-Instruct עם התאמות של חוקרי סטנפורד להוזלת עלויות, שכללו פענוח באצוות של עשרים הוראות ויצירת דוגמה בודדת לכל משימה. הגרסה הזו לוקחת את הפלט הגולמי ומתקנת עשר בעיות מרכזיות: הוראות שמוזגו בטעות, בקשות ליצירת תמונות שהמודל לא יכל לבצע, תווים מיותרים, חוסר עקביות בסימון קלט ריק, והזיות שנבעו מהפניות למידע חיצוני ברשת. בנוסף נערכו או נכתבו מחדש שאלות לא ברורות ותוקנו תשובות שגויות, במיוחד בבעיות מתמטיקה שבהן שיעור השגיאות המקורי הוערך בכשמונים אחוז.

מתאים ל

  • כוונון מודלי שפה להוראות

    אימון מודלים בסיסיים באנגלית על 52,002 דוגמאות מובנות כדי לשפר את היכולת שלהם לעקוב אחרי פקודות.

  • מחקר על דאטה סינתטי

    ניתוח ההבדלים באיכות ובביצועים בין נתונים גולמיים ממודלים לבין נתונים שעברו סינון ותיקון ידני.

  • הערכת ביצועי מודלים

    בדיקת מודלים קיימים מול מגוון הוראות ומשימות סיווג וסיכום באנגלית כדי למדוד את רמת המענה שלהם.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על פלטים של מודל ישן, text-davinci-003, כך שאין כאן עברית כלל. למרות עבודת הניקוי המקיפה, המאגר נשען על טקסט סינתטי ויכול להכיל הטיות ושגיאות שיורשות מיכולות המודל המקורי. מי שבונה מודל ייעודי לפתרון בעיות חישוב או משימות שדורשות דיוק עובדתי מוחלט חייב לבדוק את הדוגמאות בעצמו לפני תחילת העבודה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

יש פער בין כותרת המאגר שמציינת רישיון פתוח לבין התיאור שנוקב ברישיון CC BY-NC 4.0 המגביל למטרות לא-מסחריות. בגלל חוסר ההתאמה הזה, לא כדאי להסתמך עליו במוצרים מסחריים.

האם יש במאגר נתונים בעברית?

לא. כל 52,002 הרשומות נוצרו באנגלית בלבד. אם המטרה היא לאמן מודל שיבין עברית, המאגר הזה לא יספק מענה ללא תרגום.

איך נאספו הנתונים במקור?

החוקרים בסטנפורד השתמשו במודל text-davinci-003 של OpenAI כדי לייצר את ההוראות והתשובות בתהליך אוטומטי זול. הגרסה הזו לקחה את הפלטים וסיננה תקלות טכניות, הזיות ותשובות שגויות.

מה ההבדל בין גרסה זו למאגר המקורי?

במקור היו בעיות כמו שאלות שדרשו תמונות, שדות ריקים, כפל הוראות באותה רשומה וכשמונים אחוז שגיאות בחישובים מתמטיים. הגרסה הזו מנקה את התקלות ומתקנת את הניסוחים.

איך טוענים

המאגר מורכב משלושה קבצים, כשהנתונים עצמם יושבים בקובץ alpaca_data_cleaned.json לצד קובץ README. אין צורך לבקש אישור גישה או להמתין למפתח. כל הרשומות מרוכזות בחלוקת train יחידה. בעת הטעינה יש לשים לב לארבעת השדות בכל רשומה: instruction, input, output והשדה text, שכבר מכיל את הפורמט המובנה לאימון.

from datasets import load_dataset

ds = load_dataset("unsloth/alpaca-cleaned")

הרישיון

המטא-דאטה מציג רישיון cc-by-4.0, אך הטקסט בגוף הכרטיס מציין רישיון מחמיר יותר מסוג CC BY-NC 4.0 המגביל את השימוש למטרות לא-מסחריות בלבד ומחייב מתן קרדיט. הסתירה הזו דורשת זהירות, שכן אם התנאי הלא-מסחרי תקף, אסור להשתמש במאגר או במודל שאומן עליו למוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗