GPT
D

DPO_Pairs-Roleplay-Alpaca-NSFW

קוד פתוח

athirdpathcc-by-nc-4.02023-12-06

  • not-for-all-audiences

מאגר קטן של זוגות העדפה למשחקי תפקידים ותוכן ארוטי, שנועד לאימון DPO. מי שמחפש לכוונן מודל שיפסיק לסרב לתרחישי NSFW ולא ייפול לסירובים גנריים ימצא בו עניין.

  • 97הורדות בחודש
  • 81לייקים

מה זה

המאגר כולל סביב 3,400 זוגות של תגובות נבחרות ונדחות בפורמט שמתאים ל־DPO. כעשרה אחוזים מהטקסט נוצרו בעזרת GPT-4, וכל השאר הופקו ישירות מהמודל Iambe בגרסאות מכומתות שונות, עם טמפרטורה גבוהה יחסית של 1.2. המטרה המוצהרת היא ERP, כלומר משחקי תפקידים ארוטיים, כך שחלק ניכר מהמצבים מפורש מאוד, לצד תרחישי רקע רגילים של ספורט והרפתקאות.

המבנה נשען על יצירה מקבילה שבה פרומפט כפול חילץ את שתי התשובות בו זמנית. בכמה עשרות מקרים שבהם המודל כשל בייצור התגובה הלא רצויה, היוצר שתל ידנית סירוב תאגידי בסגנון כמודל שפה אני לא יכול. שגיאות עיצוב של המודל נותבו בכוונה לעמודת התשובות הדחויות, כדי ללמד את המודל הבא להימנע מהן.

מתאים ל

  • אימון DPO למשחקי תפקידים

    כוונון העדפות למודלי שיחה באנגלית המיועדים לתרחישי RP ו־ERP ללא סירובים תאגידיים.

  • הפחתת סירובים אוטומטיים

    שימוש בזוגות שבהם הסירוב המובנה מוגדר כ־rejected כדי ללמד מודלים להתמודד עם תוכן בוגר.

  • התנסות באימון cDPO

    הרצת מחברת הפייתון המצורפת כבסיס לבדיקת תהליכי אימון DPO על חומרה שכורה.

איפה זה נופל

הנתונים לא עברו ניקוי ידני מקיף אלא רק בדיקות מדגמיות והחלפות טקסט בסיסיות, כך שרוב התוכן לא נקרא מעולם על ידי אדם. היוצר עצמו מודה שחלק מתשובות ה־chosen סובלות מבעיה מוכרת שבה המודל מדבר בשם המשתמש במקום להגיב לו. בנוסף, כל החומר באנגלית בלבד, ואין כאן מילה אחת בעברית. לפני שדוחפים את זה לאימון, צריך לקחת בחשבון שהאיכות פראית ומלאה ברעשים סינתטיים של מודלים שמזינים את עצמם.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא. הרישיון המוגדר הוא cc-by-nc-4.0, מה שאוסר במפורש שימוש מסחרי בנתונים ובתוצרים שנגזרים מהם ישירות.

האם יש בדאטהסט תמיכה בעברית?

אין במאגר עברית בכלל. כל הנתונים הופקו באנגלית בלבד ונועדו למודלים דוברי אנגלית.

איך נוצרו הנתונים בפועל?

הטקסט סינתטי כמעט לחלוטין. כעשרה אחוזים נוצרו עם GPT-4 והיתר הופקו מהמודל Iambe בשילוב הנחיות שנועדו לחלץ תגובה רצויה ותגובה דחויה באותה ריצה.

האם הנתונים עברו סינון אנושי?

רק בדיקות שטח חלקיות. היוצר מעיד שמרבית הרשומות לא נקראו על ידי אדם, ויש בהן בעיות כמו מודל שעונה במקום המשתמש.

איך טוענים

הנתונים יושבים בקובץ DPO_Pairs-Roleplay-NSFW.jsonl שפתוח להורדה ישירה ללא צורך באישור גישה. במאגר יש בסך הכל ארבעה קבצים, כולל מחברת עבודה להרצה ב־RunPod עם cDPO שהיוצר השאיר כבסיס לאימון. תצטרכו לחלץ מהשורות בעיקר את שדות הפרומפט, ה־chosen וה־rejected. בגלל שמדובר ב־3,400 רשומות בלבד, הקובץ קל מאוד ונטען ישירות לזיכרון בכל סביבת פיתוח פשוטה.

from datasets import load_dataset

ds = load_dataset("athirdpath/DPO_Pairs-Roleplay-Alpaca-NSFW")

הרישיון

המאגר פורסם תחת רישיון cc-by-nc-4.0. המשמעות ברורה וחד משמעית, אין כאן שום היתר לשימוש מסחרי, וכל מודל שתאמנו על הדאטהסט הזה מוגבל למחקר, ניסויים אישיים או שימוש לא מסחרי בלבד. בנוסף, חובה לתת ייחוס ליוצר המקורי athirdpath.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗