GPT
A

Alpaca-CoT

קוד פתוח

QingyiSiapache-2.02023-03-25

  • Instruction
  • Cot

מאגר ענק שמרכז עשרות סטים של הוראות ושרשראות מחשבה בפורמט אחיד. מתאים למי שרוצה לאמן מודל שיחה ומחפש מקורות מוכרים כמו אלפקה ופלאן במקום אחד.

  • 12,596הורדות בחודש
  • 786לייקים

מה זה

המאגר מכיל אוסף רחב של נתוני כוונון הוראות שנאספו ממקורות שונים ברשת. כל רשומה במאגר הומרה למבנה קבוע של שלושה שדות: הוראה, קלט שעשוי להיות ריק, ותשובה. המקורות כוללים בין היתר את סט ההוראות המקורי של אלפקה מסטנפורד, גרסאות שנוצרו על ידי מודלים שונים כמו גרסת אלפקה מבוססת גיפיטי 4, נתוני שרשרת מחשבה מתשע משימות של פלאן, קוד מתוך קוד אלפקה, נתונים פיננסיים, ושיחות מתוך פרויקטים כמו גואנאקו ואינסטראקט.

הנתונים נאספו ישירות ממאגרים ציבוריים של פרויקטים קיימים. בחלק מהמקרים נעשה עיבוד נוסף על ידי היוצרים המקוריים, כמו ניקוי ארטיפקטים של טוקניזציה או תרגום לסינית בעזרת גוגל תרגום וצ'אט גיפיטי. החלוקה במאגר מתבצעת לפי תיקיות וקבצי ג'ייסון נפרדים לכל מקור, לצד קבצי שילוב מיוחדים שמאחדים כמה מקורות יחד, כמו שילוב של אלפקה, בל ושרשראות מחשבה לקובץ אחד.

מתאים ל

  • כוונון מודלים בסיסי

    אימון מודל שפה פתוח על הוראות כלליות באנגלית כדי לשפר את יכולת השיחה והבנת ההנחיות שלו.

  • אימון שרשראות מחשבה

    שימוש בקבצי פלאן כדי ללמד מודלים לפרק בעיות מורכבות לשלבים לוגיים לפני מתן התשובה הסופית.

  • יצירת מודל קוד

    אימון על בסיס נתוני קוד אלפקה כדי לחזק יכולות פיתוח ויצירת קטעי תוכנה מתוך תיאור מילולי.

איפה זה נופל

הבעיה העיקרית במאגר היא איכות הנתונים והשפות. חלק גדול מהטקסטים נוצרו בצורה סינתטית על ידי מודלים כמו גיפיטי 4 או תורגמו לסינית באמצעות גוגל תרגום, מה שמכניס טעויות תרגום והזיות מובנות. בנוסף, אין במאגר עברית כלל. השפות הנתמכות הן אנגלית, סינית ומלאיאלאם, לצד ריבוי שפות בקובץ אקס פי 3. הנתונים פורסמו במרץ 2023, כך שהידע בהם אינו עדכני, ויש לבדוק ידנית את איכות הפלטים לפני שמזינים אותם למודל שמיועד לסביבה מבצעית.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. המאגר מכיל בעיקר אנגלית וסינית, ואין בו נתונים בעברית לפי התיעוד. אם המטרה היא עבודה בעברית, תצטרכו לתרגם את הנתונים בעצמכם או להשתמש במקורות אחרים.

האם מותר להשתמש בנתונים למטרות מסחריות?

הרישיון המוצהר של המאגר הוא אפאצ'י 2.0 שמאפשר שימוש מסחרי, אך חלק ניכר מהנתונים נוצר בעזרת מודלים של אופן איי איי. תנאי השימוש של אותם מודלים עשויים להגביל שימוש מסחרי שמתחרה בהם, ולכן כדאי לבדוק את מקור הקובץ הספציפי שבו אתם משתמשים.

איך בנויים הנתונים בתוך הקבצים?

כל קובץ בנוי כמערך ג'ייסון שבו כל איבר מכיל שלושה שדות: הוראה, קלט רקע שעשוי להיות ריק, ותשובה רצויה. המבנה הזה אחיד לכל אורך הקבצים במאגר ומותאם ישירות לתבניות של אלפקה.

מה ההבדל בין המאגר הזה למאגר אלפקה המקורי?

מאגר אלפקה המקורי הכיל רק כחמישים ושניים אלף נתונים באנגלית. המאגר הזה משלב את הנתונים ההם יחד עם עשרות מאגרי הוראות נוספים, כולל נתוני פלאן, קוד, שיחות סיניות ונתונים פיננסיים, כולם תחת אותו פורמט בדיוק.

איך טוענים

המאגר כולל 1,886 קבצים, רובם המוחלט קבצי ג'ייסון סטנדרטיים וקובץ זיפ אחד של משימות טבעיות. הגישה חופשית לגמרי ואינה דורשת אישור מיוחד. כדי לעבוד איתו בדרך כלל לא טוענים את כל המאגר בבת אחת, אלא מורידים ישירות את קובץ הג'ייסון הספציפי שמעניין אתכם מתוך התיקייה הרלוונטית. המבנה של כל דוגמה פשוט ואחיד, כך שכל סקריפט אימון שמצפה למפתחות הוראה, קלט ופלט יכול לקרוא את הנתונים ישירות בלי צורך בהמרות נוספות.

from datasets import load_dataset

ds = load_dataset("QingyiSi/Alpaca-CoT")

הרישיון

המאגר מדווח תחת רישיון אפאצ'י 2.0, שמתיר שימוש מסחרי, שינוי והפצה ללא תמלוגים. עם זאת, החומרים נאספו מעשרות פרויקטים שונים, וחלקם נוצרו באמצעות מודלים של אופן איי איי שהגבילו שימוש בתוצרים שלהם לאימון מודלים מתחרים. הדרישה המפורשת של המפרסמים היא מתן קרדיט לפרויקט המאגד וכן לחוקרים המקוריים של אלפקה, בל ופלאן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗