GPT
A

alpaca-zh

קוד פתוח

shibing624cc-by-4.02023-03-25

  • gpt
  • alpaca
  • fine-tune
  • instruct-tune
  • instruction

כאן תמצאו דאטהסט הוראות בסינית שנוצר בעזרת GPT4 לפי שיטת self instruct. הוא מתאים למי שרוצה לאמן מודלים לעקוב אחרי פקודות בשפה הזו.

  • 5,802הורדות בחודש
  • 145לייקים

מה זה

המאגר מבוסס על שיטת Alpaca ומכיל נתונים שנוצרו על ידי GPT4 בגישת self instruct, בהיקף של כחמישים אלף רשומות. המקור מגיע מהפרויקט Instruction Tuning with GPT-4 של חוקרים כמו באולין פנג ואחרים, כשהמטרה היא לספק נתוני כוונון עדין למודלי שפה.

הרשומות מיועדות למשימות ייצור טקסט ומכילות דוגמאות של פקודות והתשובות שחולצו מהמודל בסינית. לפי המידע שפורסם, מדובר בקובץ יחיד בשם alpaca_gpt4_data_zh.json שלקוח ישירות מהמאגר המקורי של הפרויקט, ללא פירוט נוסף לגבי שלבי סינון מיוחדים או חלוקה מובנית לחלקי אימון ומבחן.

מתאים ל

  • אימון מודלים בסינית

    כוונון עדין של מודלי שפה כדי שילמדו לעקוב אחרי הוראות ומשימות שונות בסינית.

  • מחקר על דאטה סינתטי

    בדיקת איכות התוצרים של מודלים שאומנו על נתוני self instruct שמקורם ב־GPT4.

  • השוואת ביצועים אקדמית

    בחינת יכולות של מודלים מול מאגרי הוראות מקבילים במסגרת ניסויים ומחקר.

איפה זה נופל

הנתונים כולם בסינית בלבד, כך שאין כאן שום מענה למי שמחפש עברית או אנגלית. הנתונים יוצרו מראשית דרכו של GPT4 במרץ 2023, בלי פירוט בכרטיס לגבי בדיקות איכות אנושיות או סינון של הזיות וטעויות. הבעיה המרכזית היא חוסר התאמה מוחלט בין הרישיונות. במטא דאטה מופיע רישיון פתוח, אבל בגוף הטקסט המחברים מציינים במפורש שהחומר מוגבל למחקר בלבד ואסור לשימוש מסחרי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הטקסט בכרטיס הדאטהסט קובע במפורש שהוא מיועד למחקר בלבד. למרות שבשדות המערכת רשום רישיון פתוח יותר, גוף הכרטיס אוסר שימוש מסחרי וקובע שמודלים שיאומנו עליו לא ייצאו מגבולות המחקר. אם אתם בונים מוצר רווחי, המאגר הזה לא מתאים.

האם יש בדאטהסט תמיכה בעברית?

אין במאגר הזה עברית כלל, וכל התוכן מוגדר ומיוצר בסינית בלבד. המפרסם מפנה למאגר מקביל באנגלית, אך לא קיים כאן תוכן מקומי. מי שמחפש פקודות בעברית יצטרך לפנות למאגרים אחרים לגמרי.

איך הנתונים נאספו והופקו?

הנתונים נוצרו בעזרת GPT4 בשיטת self instruct, בהתבסס על המתודולוגיה של פרויקט Alpaca המקורי. מדובר בהפקה אוטומטית של פקודות ותשובות בסינית מתוך המודל, כחלק ממחקר של חוקרי מיקרוסופט ואוניברסיטאות שותפות. המאגר מכיל עותק ישיר של הקובץ שפורסם באותו פרויקט.

כמה רשומות יש בפנים ומה גודל הקבצים?

הדאטהסט מכיל כחמישים אלף רשומות שמרוכזות בקובץ JSON יחיד. המאגר כולו כולל שלושה קבצים, כולל קובץ התיעוד, כך שמדובר במשקל נמוך שאינו דורש משאבי אחסון מיוחדים. אפשר להוריד אותו בקלות ישירות למחשב או לסביבת העבודה.

איך טוענים

טוענים את הקובץ ישירות מתוך המאגר באמצעות קריאת קובץ ה־JSON בשם alpaca_gpt4_data_zh.json, או דרך ספריית הדאטהסטים לפי הנתיב של המאגר. אין צורך לבקש אישור גישה מראש כדי להוריד את הקבצים. המאגר כולל שלושה קבצים בלבד, כך שההורדה מהירה ופשוטה. לפני שמתחילים לאמן, שימו לב שהמפרסם מפנה לשימוש בספריית textgen שלו לצורך כוונון המודלים על גבי הנתונים האלה.

from datasets import load_dataset

ds = load_dataset("shibing624/alpaca-zh")

הרישיון

במטא דאטה של המאגר מצוין רישיון cc-by-4.0, אבל בתיאור עצמו נכתב במפורש שהדאטהסט הוא ברישיון CC BY NC 4.0 לשימוש מחקרי בלבד. זה אומר שאסור להשתמש בו לצרכים מסחריים, ומודלים שתאמנו עליו מוגבלים למחקר בלבד ולא מיועדים לפרודקשן.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗