GPT
C

CoSER

קוד פתוח

Neph0smit2025-02-25

מאגר שיחות מרובות משתתפים שחולצו ישירות מתוך 771 רומנים מוכרים. הוא נבנה כדי לאמן מודלים למשחקי תפקידים על בסיס ספרות אותנטית, יחד עם מחשבות פנימיות ופעולות של הדמויות.

  • 971הורדות בחודש
  • 86לייקים

מה זה

המאגר מכיל דיאלוגים מרובי משתתפים ורבי סבבים שנלקחו מתוך ספרות עלילתית, ולא נוצרו בצורה סינתטית על ידי מודלים אחרים. הרשומות כוללות לא רק את הטקסט המדובר, אלא גם פרופילים מפורטים של הדמויות, תקצירי עלילה, רקע היסטורי לכל שיחה, וכן את המחשבות הפנימיות והפעולות הפיזיות של הדמויות במהלך האינטראקציה.

המבנה מחולק לשלושה חלקים מרכזיים. בתיקיית train יש קובץ יחיד בפורמט ShareGPT שמוכן לאימון SFT, בתיקיית test יש 200 דוגמאות ששימשו להערכה במאמר המקורי, ותיקיית full מכילה קובץ JSON נפרד עבור כל ספר עם המידע המלא שחולץ ממנו.

מתאים ל

  • אימון מודלים למשחק תפקידים

    לימוד מודלים לדבר בקול של דמות ספציפית תוך שמירה על המחשבות, הרקע והאופי שלה.

  • הערכת עקביות של פרסונות

    בדיקת היכולת של סוכנים מלאכותיים להישאר בתוך תפקיד מוגדר באמצעות 200 דוגמאות המבחן.

  • סימולציות מרובות משתתפים

    אימון סוכנים לתקשר בסביבה שבה משתתפות מספר דמויות בו זמנית עם מניעים שונים.

איפה זה נופל

כל החומר מבוסס על ספרות באנגלית בלבד, ואין כאן שום ייצוג לעברית או לשפות אחרות. מעבר לכך, מדובר בטקסטים ספרותיים דרמטיים, שלעיתים רחוקות משקפים דיבור יומיומי מציאותי, עובדה שעלולה להגביל מודלים שמיועדים לשירות לקוחות או לשיחות שגרתיות. בנוסף, הצוות ביצע סינון בטיחות שקטע 110 שיחות ומחק 602 הודעות בסך הכל, המסומנות בשדה ייעודי, כך שמומלץ לבדוק את נקודות החיתוך הללו לפני שרצים לאמן על הנתונים.

שאלות
נפוצות

האם הדאטהסט כולל טקסטים בעברית?

לא. כל הנתונים מבוססים על 771 ספרים בשפה האנגלית בלבד. אם המטרה היא אימון בעברית, תצטרכו לתרגם את הנתונים באופן עצמאי או לחפש מקור אחר.

איך המידע הזה שונה ממאגרי שיחות רגילים?

בניגוד לדיאלוגים סינתטיים שנכתבו על ידי מודלים, כאן הדיאלוגים חולצו מספרים אמיתיים. בנוסף, הרשומות כוללות פעולות פיזיות, מחשבות פנימיות של הדמויות והקשר עלילתי רחב ולא רק שורות טקסט יבשות.

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון המוגדר בפרויקט הוא MIT, שמתיר שימוש מסחרי באופן חופשי. למרות זאת, כיוון שהתוכן נאסף מתוך רומנים מודרניים וידועים, יש לקחת בחשבון את זכויות היוצרים של היצירות המקוריות עצמן.

האם הנתונים מוכנים לאימון מיידי?

כן, בתיקיית train נמצא קובץ בפורמט ShareGPT שמתאים ישירות לאימון SFT. מי שמעוניין בהקשר המלא ובפרופילים המורחבים של הספרים יצטרך לעבוד עם קובצי ה־JSON בתיקיית full.

איך טוענים

הנתונים מגיעים בקובצי JSON רגילים, ללא צורך בהרשאה מיוחדת או בבקשת גישה מראש. בגלל המורכבות והגודל של המבנה הפנימי, מציג הנתונים של Hugging Face מתקשה להציג אותם בצורה תקינה, ולכן עדיף להוריד את הקבצים ישירות או לבדוק את הדוגמאות שהועלו לגיטהאב. מי שרוצה לגשת ישר לאימון יכול לטעון את הקובץ המוכן בתיקיית train שמסודר מראש לפי מבנה השיחות של ShareGPT.

from datasets import load_dataset

ds = load_dataset("Neph0s/CoSER")

הרישיון

המאגר מופץ תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה ללא דרישה לשיתוף תחת אותו רישיון, ומחייב רק מתן קרדיט וצירוף הרישיון המקורי. עם זאת, מכיוון שהטקסטים חולצו מתוך רומנים מפורסמים שחלקם עשויים להיות מוגנים בזכויות יוצרים מקוריות, כדאי לנקוט משנה זהירות משפטית לפני שמשלבים אותו במוצר מסחרי סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗