GPT
G

generated_chat_0.4M

קוד פתוח

BelleGroupgpl-3.02023-04-08

כארבע מאות אלף שיחות מבוססות דמויות בסינית שנוצרו על ידי ChatGPT. הוא נועד לאימון מודלים שצריכים לנהל שיחה לפי רקע ואישיות מוגדרים.

  • 257הורדות בחודש
  • 69לייקים

מה זה

המאגר מכיל כארבע מאות אלף רשומות סינתטיות של דיאלוגים מותאמים אישית. כל רשומה כוללת תיאור של דמויות והנחיה לקיים ביניהן שיחה, לצד השיחה עצמה שנוצרה בהתאם לרקע שסופק. הנתונים יוצרו במסגרת פרויקט BELLE באמצעות ChatGPT ולא עברו סינון אנושי קפדני או אימות של העובדות המוצגות בהם.

המבנה של כל דוגמה מורכב משלושה שדות. שדה ההנחיה מכיל את תיאורי הדמויות והבקשה ליצירת הדיאלוג, שדה הקלט ריק לחלוטין בכל הרשומות במאגר, ושדה הפלט כולל את חילופי הדברים בין הדמויות. אין כאן חלוקה מובנית לחלקי אימון, בדיקה או ולידציה, אלא קובץ יחיד שמרכז את כלל הנתונים.

מתאים ל

  • אימון משחקי תפקידים בסינית

    לימוד מודלים כיצד לנהל דיאלוג לפי אישיות ורקע של דמות מוגדרת מראש.

  • מחקר על דאטה סינתטי

    בדיקת איכות והשפעה של טקסט שנוצר ישירות מ־ChatGPT על מודלי שיחה.

  • הערכת עקביות של דיאלוגים

    מדידת יכולת המודל לשמור על עמדה ואינטרס לאורך חילופי דברים מרובים.

איפה זה נופל

הנתונים כולם בסינית בלבד, כך שאין כאן מילה בעברית או באנגלית והוא לא יעזור למי שבונה מודל מקומי. המפתחים מודים במפורש שהטקסט יוצר ישירות על ידי ChatGPT באפריל 2023 ללא בדיקה קפדנית, ולכן הוא כולל שגיאות עובדתיות ובעיות דיוק בתוכן. בנוסף, מודל שמתאמן על פלטים של מודל אחר ללא בקרת איכות עלול לסבול מהזיות והטיות שהיו קיימות במקור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. למרות שמצוין רישיון gpl-3.0, היוצרים הגדירו תנאי שימוש ברורים שאוסרים על שימוש מסחרי ומגבילים את הנתונים למחקר בלבד. חברות שמחפשות דאטה למוצר מסחרי צריכות להימנע ממנו לחלוטין.

האם המאגר כולל שיחות בעברית?

אין במאגר עברית בכלל. כל הדיאלוגים וההנחיות נכתבו בסינית בלבד, והוא רלוונטי רק למחקר בשפה זו או למערכות רב-לשוניות שכבר מכילות רכיבי תרגום.

איך נאספו הנתונים והאם עברו בדיקת איכות?

הנתונים יוצרו באופן אוטומטי לחלוטין באמצעות ChatGPT באפריל 2023 במסגרת פרויקט BELLE. היוצרים מצהירים בגלוי שהם לא ביצעו אימות קפדני, כך שיש לקחת בחשבון שגיאות עובדתיות בטקסט.

למה שדה ה־input ריק בכל הרשומות?

היוצרים בחרו לרכז את כל המידע המקדים, כולל רקע הדמויות וההנחיות לפעולה, ישירות בתוך שדה ה־instruction. שדה ה־input נשאר ריק כחלק מתבנית קבועה, והתשובה המלאה של השיחה מופיעה בשדה ה־output.

איך טוענים

טוענים את המאגר ישירות מקובץ generated_chat_0.4M.json או באמצעות ספריית הדאטהסטים הרגילה. המאגר פתוח להורדה מיידית ואינו דורש אישור גישה מיוחד מהיוצרים. בזמן הטעינה תפגשו את השדות instruction, input ו־output, כאשר input תמיד ריק, כך שכל תוכן השיחה וההוראות יושב בשני השדות האחרים בלבד.

from datasets import load_dataset

ds = load_dataset("BelleGroup/generated_chat_0.4M")

הרישיון

הרישיון המדווח במאגר הוא gpl-3.0, אך בטקסט עצמו היוצרים אוסרים במפורש על שימוש מסחרי ומגבילים את השימוש למחקר בלבד. הסתירה הזו אומרת שאסור לגעת בו לפרויקטים מסחריים או למוצרים חיים. אם אתם חוקרים, קחו בחשבון שקוד ומודלים שנגזרים ממנו עשויים לדרוש שיתוף תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗