GPT
S

Sonnet3.5-Charcard-Roleplay

קוד פתוח

Grypheunknown2024-08-18

  • synthetic
  • not-for-all-audiences

שיחות רולפליי סינתטיות שנוצרו באמצעות Sonnet 3.5 על בסיס כרטיסי דמויות. מי שמחפש לשפר כתיבה יצירתית ומשחקי תפקידים בלי קריסות של מודל מול עצמו ימצא כאן חומר גלם מעניין.

  • 594הורדות בחודש
  • 95לייקים

מה זה

המאגר מכיל 9,736 דיאלוגים מלאים שפותחו סביב כרטיסי דמויות קיימים. כדי לייצר אינטראקציה מגוונת, הוסיפו לכל כרטיס משתמש מדומה, גבר או אישה, עם ארבעה טיפוסי אישיות בחלוקה מאוזנת. התוכן נוצר בקריאה בודדת למודל עבור כל סצנה מלאה, כדי למנוע הידרדרות של בינה מלאכותית שמגיבה לעצמה בלולאה.

הטקסטים עברו עשרות בדיקות תקינות של עיצוב, אורך והשתלטות על פעולות הדמות השנייה. בשלב הניקוי החליפו אזכורים של שמות משתמש במשתנה קבוע, והחליפו ביטויים שחוזרים על עצמם בניסוחים חלופיים שהופקו דרך GPT-4o כדי לשמור על גיוון לשוני.

מתאים ל

  • אימון מודלי רולפליי

    כוונון עדין למודלי שפה פתוחים כדי לשפר את היכולת שלהם להחזיק דמות מורכבת ועקבית לאורך סצנה.

  • בדיקת גבולות בטיחות

    הערכת עמידות של מודלים בפני תוכן קשה, אלים או מיני שנוצר על ידי משתמשים בדיאלוגים חופשיים.

  • מחקר על דאטה סינתטי

    ניתוח איכות השיחה ודפוסי חזרתיות בטקסטים שנוצרו בקריאה אחת מול מודלים מתקדמים.

איפה זה נופל

התוכן כולל כמות משמעותית של חומרים למבוגרים וסצנות קשות, והיוצר מזהיר מפניהם במפורש. אם אתם בונים מוצר לקהל רחב או לשירות לקוחות, המאגר הזה פשוט מסוכן לשימוש. בנוסף, כל הנתונים נוצרו באנגלית בלבד. אין כאן מילה בעברית, וכל התוכן הוא סינתטי לחלוטין ונשען על היכולות של Sonnet 3.5 ועל שכתובים של GPT-4o, עם כל ההטיות והסגנון של מודלים אלה מאוגוסט 2024.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון מוגדר כלא ידוע, ואין שום היתר רשמי לשימוש מסחרי. בנוסף, הנתונים הופקו באמצעות מודלים מסחריים וכרטיסי דמויות מהרשת, מה שיוצר סיכון משפטי ברור.

האם יש בדאטהסט תמיכה בעברית?

אין בו עברית כלל. כל 9,736 הדיאלוגים נוצרו ונשמרו באנגלית בלבד. אם המטרה שלכם היא מודל שמבין או כותב בעברית, תצטרכו לתרגם את הנתונים או לחפש מקור אחר.

איך נוצרו השיחות ומה מייחד אותן?

השיחות נוצרו באמצעות קריאה בודדת ל־Sonnet 3.5 לכל סצנה, במקום דיאלוג מתמשך בין שני מודלים שנוטה להתבלגן. לאחר מכן הנתונים עברו סינון של שגיאות עיצוב, והביטויים הנפוצים ביותר הוחלפו דרך GPT-4o לגיוון השפה.

איזה סוג תוכן יש בשיחות?

מדובר במשחקי תפקידים לפי כרטיסי דמויות, שחלק ניכר מהם מכיל תוכן בוטה, מיני וסצנות מטרידות. יוצר המאגר הדגיש אזהרה ברורה לגבי תוכן למבוגרים, כך שזה לא מתאים למודלים לשימוש כללי.

איך טוענים

אתם מושכים את הקובץ ישירות מתוך המאגר, שם מחכה קובץ בשם sonnet35-charcard-roleplay-sharegpt.jsonl. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה כחלק משלושת הקבצים שפורסמו בו.

המבנה מגיע בתצורת ShareGPT סטנדרטית שמתאימה ישירות לרוב ספריות האימון של מודלי שיחה. לפני שמתחילים להריץ אימון, בדקו את שדות השיחה כדי לוודא שהחלפת המשתנה {{user}} תואמת לפורמט הפרומפט שבו אתם עובדים בפועל.

from datasets import load_dataset

ds = load_dataset("Gryphe/Sonnet3.5-Charcard-Roleplay")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות פשוטה: אין לכם שום אישור משפטי מפורש להשתמש בנתונים, בטח שלא לפיתוח מודל מסחרי. מעבר לזה, המאגר כולל פלטים של מודלים מסחריים סגורים וכרטיסי דמויות של יוצרים שונים, כך שאימון מודל עליו חושף אתכם לסיכוני זכויות יוצרים ותנאי שימוש.

הרישיון המלא ב־Hugging Face ↗