GPT
P

PIPPA

קוד פתוח

PygmalionAIapache-2.02023-08-08

  • not-for-all-audiences
  • conversational
  • roleplay
  • custom-format
  • a.

מאגר שיחות ומשחקי תפקידים שנאסף ישירות מיוזרים שדיברו עם בוטים, ומיועד למי שרוצה ללמד מודל לדבר בגוף ראשון כמו דמות. הוא מכיל מעל מיליון שורות דיאלוג ולא מתאים למי שמחפש בוט שירות רגוע.

  • 697הורדות בחודש
  • 250לייקים

מה זה

המאגר מכיל עשרים ושש אלף שיחות מלאות שמורכבות מיותר ממיליון שורות דיאלוג בין אנשים לבין מודל השפה של אתר Character.AI. הנתונים נאספו לאורך מספר חודשים ישירות מחברי קהילת Pygmalion שהעלו את הלוגים שלהם ואישרו את הפצתם לציבור. צוות הפרויקט עבר על החומר כדי להסיר או לערוך פרטים אישיים מזהים שנחשפו בצ'אטים.

בפנים תמצאו מעל אלף דמויות שונות, כולל דמויות אמיתיות ודמיוניות. הרשומות מגיעות בשלושה קבצים עיקריים: הקובץ המקורי, גרסה שעברה ניקוי של כפילויות ומחיקה של שיחות עם פחות משלושה תורות, וגרסה שלישית שמותאמת במבנה שלה למודלי Metharme. כל שורה היא שיחה שלמה שמכילה את תיאור הדמות, הגדרות האישיות שיוצר הבוט הזין באתר, קטגוריות, הודעת הפתיחה וההתכתבות המלאה עם סימון מפורש מתי מדובר בבן אדם ומתי במודל.

מתאים ל

  • אימון דמויות וירטואליות

    לימוד מודלים איך לשמור על אישיות עקבית, סגנון דיבור ייחודי וטון מוגדר לאורך שיחה שלמה.

  • כתיבת דיאלוגים למשחקים

    יצירת שיחות אינטראקטיביות עבור דמויות בלי שחקן (NPCs) שיודעות להגיב בצורה טבעית למשתמש.

  • מחקר על צ'אטבוטים לא מסוננים

    ניתוח האופן שבו בני אדם מפתחים קשר רגשי או מנהלים שיחות עמוקות ופתוחות עם מודלי שפה.

איפה זה נופל

זהירות לגבי התוכן, המאגר כולל שיחות עם תכנים בוטים, אלימים או מיניים לחלוטין. אם תאמנו מודל רק עליו, הוא יפיק תוצרים למבוגרים בלי סינון. מבחינת שפה יש כאן אנגלית בלבד, כך שלא תמצאו עברית. בנוסף, שדה הגדרות הבוט לעיתים ריק, והוא דורש עיבוד מקדים בגלל הפורמט שבו הוא נשמר. הנתונים מבוססים על מה שמשתמשים בחרו להעלות ביוזמתם, ולכן יש הטיה ברורה לעולמות הפנטזיה, האנימה ומשחקי התפקידים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון הרשמי הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא. עם זאת, השיחות הגיעו ממשתמשים ששוחחו עם מודל של Character.AI, ולכן חברות מסחריות צריכות לשקול את הסיכון המשפטי שנובע משימוש בפלטים של שירות צד שלישי.

האם יש במאגר שיחות בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד, ואינו כולל נתונים בעברית.

איך הנתונים נאספו בפועל?

המידע נאסף מיוזמה קהילתית שבה משתמשים ייצאו את היסטוריית השיחות שלהם מאתר Character.AI והעבירו אותה ליוצרי הפרויקט. נכללו במאגר רק שיחות שבעליהן נתנו אישור מפורש להפצה ציבורית, לאחר שעברו עריכה להסרת פרטים מזהים.

איזה קובץ מומלץ להוריד מתוך המאגר?

עדיף לעבוד עם הגרסה הנקייה שנקראת pippa_deduped.jsonl. בגרסה זו הסירו שיחות כפולות ומחקו אינטראקציות קצרות מדי שמכילות פחות משלושה חילופי דברים.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטים של HuggingFace בלי צורך לבקש אישור גישה מוקדם. ברירת המחדל מורידה את הקובץ הנקי, אך אפשר לבחור בגרסה הגולמית או בזו שמותאמת להנחיות. כל הקבצים שמורים בפורמט JSONL, והשדות החשובים לעיבוד הם שדה השיחה והגדרות הבוט, שדורשות ניקוי מוקדם של הפורמט הספציפי שהגיע מהאתר המקורי.

from datasets import load_dataset

ds = load_dataset("PygmalionAI/PIPPA")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה, כל עוד אתם מצרפים קרדיט ומציינים שינויים שביצעתם. למרות שהרישיון מתיר זאת, כדאי לזכור שהנתונים נאספו במקור מאינטראקציות באתר חיצוני, ולכן במקרה של מוצר מסחרי כדאי לבדוק היטב את שאלת זכויות היוצרים של השיחות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗