GPT
S

soda

קוד פתוח

allenaicc-by-4.02023-01-04

  • dialogue
  • narrative
  • commonsense

מאגר שיחות בהיקף של מיליוני דוגמאות שנוצרו באמצעות זיקוק מודל שפה סביב גרף ידע חברתי. הוא נותן מענה למי שמחפש שיחות טבעיות ועקביות עם תיוג של רגשות וסיבתיות.

  • 2,257הורדות בחודש
  • 157לייקים

מה זה

המאגר כולל שיחות שנוצרו בתהליך רב-שלבי על בסיס גרף הידע Atomic10x ומודל InstructGPT. התהליך מתחיל משליפת שלשות ידע של שכל ישר חברתי, המרתן למשפטים, יצירת נרטיב עלילתי, הסקת הדוברים, ולבסוף גזירת הדו שיח עצמו. הגישה הזו נועדה לעגן את השיחה בהקשר עובדתי ולהפחית הזיות.

כל רשומה מכילה את שלשת הידע המקורית, הנרטיב, רשימת חלקי השיחה, שמות הדוברים והתאמות מבוססות מידע הדדי. בנוסף, יש תיוג מפורש של כ־385 אלף שיחות עם מעל 1,700 רגשות שונים שמקושרים לדמויות ולגורם שהצית אותם. הנתונים מחולקים מראש לקבצי אימון, תיקוף ובדיקה בפורמט פרקט.

מתאים ל

  • אימון סוכני שיחה

    לימוד מודלים לנהל דיאלוג עקבי ורציף המבוסס על הקשר חברתי עשיר.

  • זיהוי וניתוח רגשות

    שימוש במאות אלפי השיחות המתויגות ברגשות כדי לזהות תגובות אנושיות והגורמים להן.

  • הסקה של שכל ישר

    בניית מודלים שמבינים את הקשר הסיבתי בין אירועים, כוונות והתנהגות בשיחה.

איפה זה נופל

המאגר כולו באנגלית בלבד ואין בו נתונים בעברית, כך שהוא לא יעזור ישירות למי שבונה מודל לשוק המקומי. השיחות נוצרו בצורה סינתטית על ידי מודל שפה משנת 2022 ולא על ידי בני אדם אמיתיים, ולכן הן משקפות את ההטיות המובנות של InstructGPT וגרף הידע שממנו הוזן. פרטי המגבלות וההשפעות החברתיות המלאים לא מפורטים בכרטיס עצמו אלא הופנו למאמר המחקרי.

שאלות
נפוצות

האם המאגר מתאים למוצר בעברית?

לא. כל הנתונים במאגר נאספו ונוצרו באנגלית בלבד. אם המטרה היא לאמן מודל ישירות על עברית, המאגר לא יספק את הסחורה ללא תרגום.

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון הוא cc-by-4.0 ולכן מבחינת יוצרי המאגר השימוש המסחרי מותר. עם זאת, יש לקחת בחשבון שהתוכן גוזר וזוקק מפלט של מודל InstructGPT, ויש לבדוק את תנאי השימוש של ספק המודל המקורי.

איך השיחות נוצרו והאם הן אמינות?

השיחות לא נכתבו על ידי אנשים אלא נוצרו על ידי InstructGPT שקיבל הקשר מגרף ידע בשם Atomic10x. לפי הערכות אנושיות במחקר, התוצאה עקבית וספציפית יותר מדאטהסטים קודמים שנכתבו בידי אדם, אך עדיין מדובר בטקסט מסונתז.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים באמצעות המזהה של המאגר, ללא צורך בהרשאת גישה מיוחדת. הקבצים שמורים בפורמט פרקט מחולק לפי train, valid ו־test. השדות המרכזיים לעבודה שוטפת הם dialogue ו־speakers לטקסט השיחה עצמו, וכן narrative ו־literal אם רוצים לשמר את ההקשר והרקע שמתוכם נבנתה האינטראקציה.

from datasets import load_dataset

ds = load_dataset("allenai/soda")

הרישיון

המאגר פורסם תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, מחקרי והתאמה של המידע, ללא חובת שיתוף תחת אותו רישיון. החובה העיקרית היא מתן קרדיט וייחוס הולם ליוצרים, כולל ציון השינויים שנעשו בנתונים. מודלים שאומנו על הנתונים אינם מחויבים ברישיון פתוח, אך יש לעמוד בדרישות הרישיון המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗