GPT
M

multiturn_chat_0.8M

קוד פתוח

BelleGroupgpl-3.02023-04-02

בערך 800 אלף שיחות מרובות תורות בסינית שנוצרו על ידי ChatGPT. המאגר מיועד למי שמאמן מודלי שיחה וצריך נפח גדול של הקשרים והיסטוריית דיאלוג.

  • 681הורדות בחודש
  • 146לייקים

מה זה

המאגר כולל סביב 800 אלף רשומות של דיאלוגים מלאכותיים בין אדם לעוזר וירטואלי, כולם בסינית. הנתונים לא נלקחו משיחות אמיתיות אלא הופקו על ידי ChatGPT במסגרת פרויקט BELLE, והמפרסמים מציינים מפורשות שהתוכן לא עבר אימות או סינון קפדני. אין כאן חלוקה מוגדרת מראש לסט אימון ובדיקה.

המבנה של כל רשומה כולל שלושה שדות: instruction, input ו־output. שדה ה־instruction מרכז את כל היסטוריית השיחה עד לאותה נקודה, כשהדוברים מופרדים בסימוני Human ו־Assistant. שדה ה־output מחזיק את תשובת העוזר לתור הנוכחי, ואילו שדה ה־input נשאר ריק לחלוטין בכל הרשומות.

מתאים ל

  • אימון מודל שיחה בסינית

    לימוד מעקב אחרי היסטוריית שיחה מרובת תורות בדיאלוג בשפה הסינית.

  • מחקר על נתונים סינתטיים

    בדיקת איכות והטיות בתשובות שנוצרו על ידי ChatGPT לצורכי מחקר בלבד.

  • כוונון הוראות למחקר

    אימון מודלים אקדמיים על מבנה פניות והנחיות שיחה של אדם ועוזר.

איפה זה נופל

הנתונים נוצרו במלואם על ידי ChatGPT ופורסמו באפריל 2023, ללא בדיקת עובדות ידנית. המפתחים עצמם מזהירים מטעויות ובעיות דיוק עובדתי בתשובות. בנוסף, כל הטקסט כתוב בסינית בלבד, כך שאין כאן שום תוכן בעברית או באנגלית. אם אתם בונים מערכת שצריכה לענות על עובדות אמיתיות, אי אפשר להסתמך על החומר הזה בלי בדיקה וניקוי מוקדמים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. למרות שהרישיון המדווח בעמוד הוא GPL-3.0, יוצרי המאגר כתבו במפורש שהשימוש בדאטה, בקוד ובכל מודל שייגזר מהם מותר למטרות מחקר בלבד, ואסור לשימוש מסחרי.

האם יש בדאטהסט שיחות בעברית?

אין בכלל עברית. כל הנתונים במאגר נוצרו בשפה הסינית בלבד, ומיועדים לאימון דיאלוגים בסינית.

איך אספו את השיחות האלה?

הנתונים לא נאספו ממשתמשים אנושיים אלא הופקו בצורה סינתטית דרך ChatGPT במסגרת פרויקט BELLE. היוצרים מציינים שהשיחות לא עברו בדיקה מחמירה ויכולות להכיל טעויות עובדתיות.

איך בנויים הנתונים בתוך הקובץ?

המאגר שמור בפורמט JSON. כל דוגמה כוללת את שדה ה־instruction שמכיל את כל מהלך השיחה הקודם, שדה input שנותר ריק, ושדה output עם התשובה האחרונה של העוזר.

איך טוענים

הנתונים יושבים בקובץ multiturn_chat_0.8M.json לצד קובץ התיעוד, ללא צורך באישור גישה מיוחד. בגלל שמדובר במאות אלפי שורות של טקסט שיחה מלא, שדה ה־instruction מחזיק טקסטים ארוכים יחסית שמשרשרים את כל התורות הקודמים. בזמן הטעינה והעיבוד צריך לשים לב לחיתוך התורות, להתעלם משדה ה־input הריק, ולפרק את הפניות של Human ו־Assistant לפורמט השיחה שמתאים למודל שלכם.

from datasets import load_dataset

ds = load_dataset("BelleGroup/multiturn_chat_0.8M")

הרישיון

הרישיון המדווח במאגר הוא GPL-3.0, אבל בטקסט עצמו המפתחים אוסרים על שימוש מסחרי ומגבילים את המאגר, הקוד והנגזרות למחקר בלבד. הסתירה הזו בין רישיון קוד פתוח מוכר למגבלה הלא מסחרית בעייתית מאוד. בפועל, אסור לבנות מזה מודל מסחרי או לשלב אותו במוצר שמייצר הכנסות.

הרישיון המלא ב־Hugging Face ↗