GPT
M

moss-002-sft-data

קוד פתוח

OpenMOSS-Teamcc-by-4.02023-04-20

שיחות שנועדו לכוונון מודלים, מבוססות הרחבות בסגנון Self-Instruct ותשובות ממודל של OpenAI. מתאים למי שבונה צ'אטבוט וצריך נתונים מוכנים באנגלית או בסינית לפי עקרונות HHH.

  • 804הורדות בחודש
  • 96לייקים

מה זה

המאגר מכיל קובצי שיחה שנוצרו עבור אימון MOSS-002, ומחולק לפי עקרונות מועילות, כנות ובטיחות בשתי שפות. הנתונים באנגלית כוללים קובץ מועילות עם 419,049 דוגמאות, קובץ כנות עם 112,580 דוגמאות, וקובץ בטיחות עם 38,873 דוגמאות. בצד הסיני יש קובץ מועילות שמכיל 447,750 דוגמאות וקובץ כנות עם 142,885 דוגמאות.

בסיס הנתונים נוצר מהרחבה של סט הנחיות אנושי קטן, בשיטה שדומה ל־Self-Instruct. את התשובות של העוזר הפיקו באמצעות מודל text-davinci-003. יוצא דופן הוא הקובץ של הבטיחות באנגלית, שבו פניות המשתמש לא הורחבו מזרעים אלא נלקחו ישירות מנתוני ה־red teaming של חברת Anthropic.

מתאים ל

  • אימון SFT למודל שיחה

    כוונון ישיר של מודלי בסיס להתנהגות כעוזר אישי באנגלית או בסינית.

  • יישור בטיחות באנגלית

    שימוש ברשומות מבוססות Anthropic כדי ללמד מודלים להתמודד עם הנחיות זדוניות.

  • מחקר על דאטה סינתטי

    בדיקת השפעת הרחבות בסגנון Self-Instruct מול פלטים שהופקו ממנועי דור קודם.

איפה זה נופל

אין כאן מילה אחת בעברית, כך שאם אתם מכוונים למודל מקומי תצטרכו לתרגם הכל או לוותר. בנוסף, כל התשובות נוצרו על ידי text-davinci-003 בתחילת 2023, מה שאומר שהידע נעצר שם ושכל ההטיות וההזיות של אותו מודל נכנסו ישירות לטקסט. כמו כן, אין קובץ בטיחות ייעודי לשפה הסינית אלא רק לאנגלית, ובאימון למוצר ישיר תצטרכו לבדוק בעצמכם שהפניות לא מקדמות תוכן פוגעני שלא סונן.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. המאגר כולל שיחות בשתי שפות בלבד, אנגלית וסינית. כדי להשתמש בו לקהל ישראלי תצטרכו להריץ תרגום מכונה עצמאי לכל הדוגמאות.

האם מותר להשתמש בזה למודל מסחרי?

הרישיון הרשמי הוא cc-by-4.0 שמתיר שימוש מסחרי בכפוף למתן קרדיט. עם זאת, התשובות נוצרו באמצעות text-davinci-003 של OpenAI, מה שעלול לייצר מגבלות תנאי שימוש חיצוניות.

כמה שוקל הדאטהסט ואיך הוא שמור?

המשקל הכולל בדיסק הוא 2.16 גיגה-בייט. המידע מסודר בקובצי JSON נפרדים לפי שפות ותחומי מועילות, כנות ובטיחות.

איך אספו את הפניות של המשתמשים?

רוב הפניות נוצרו באמצעות הרחבת סט זרעים קטן בשיטה שדומה ל־Self-Instruct. יוצא דופן הוא קובץ הבטיחות באנגלית, שבו הפניות הגיעו ישירות ממאגר red team של Anthropic.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מראש. כלל הנתונים יושבים בקובצי JSON פשוטים, והמשקל הכולל שלהם בדיסק עומד על 2.16 גיגה-בייט. אפשר להוריד ישירות דרך הספרייה של Hugging Face או למשוך את הקבצים הבודדים מהריפו. שימו לב שהחלוקה נעשית לפי קבצים נפרדים לשפות ולתחומים, כך שמומלץ לבחור מראש רק את הקבצים שרלוונטיים למשימה שלכם במקום לטעון את הכל יחד.

from datasets import load_dataset

ds = load_dataset("OpenMOSS-Team/moss-002-sft-data")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה מחדש, כל עוד אתם נותנים קרדיט מתאים למחברים המקוריים. עם זאת, התשובות הופקו ממודל של OpenAI, ולכן יש לבדוק את תנאי השירות שלהם לגבי שימוש בפלטים לאימון מודלים מתחרים לפני שמשלבים את זה במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗