GPT
E

Erotic_Literature_Collection

קוד פתוח

ystemsrxcc-by-nc-4.02024-09-04

  • porn
  • Pre-training
  • Fine-tuning
  • Explicit Content
  • Chinese

אוסף של עשרות אלפי סיפורי ארוטיקה וחוויות מיניות בסינית שמיועד לאימון מודלי שפה. מי שמחפש טקסט למבוגרים בסינית ימצא כאן חומר מחולק לנושאים ספציפיים.

  • 5,529הורדות בחודש
  • 226לייקים

מה זה

המאגר כולל 51 קובצי תוכן שמכילים סיפורים קצרים, תיאורי חוויות אישיות וטקסטים ארוטיים שונים. שמות הקבצים מעידים על חלוקה לז'אנרים ונושאים כמו פנטזיות כפריות, עיבודים לאנימה, רופאים ואחיות או סיפורי אימה ליליים. בסך הכל יש בו בין עשרת אלפים למאה אלף רשומות.

המבנה הפנימי פשוט מאוד. כל קובץ בנוי כמערך של אובייקטים, ובכל אובייקט יש מפתח בודד בשם text שמכיל את הטקסט המלא של המסמך. יוצרי המאגר לא פירטו מאיזה אתרים או מקורות הטקסטים נלקחו, ולא דיווחו על תהליך סינון, ניקוי או הסרת כפילויות שבוצע על החומר.

מתאים ל

  • אימון מקדים בסינית

    אימון מודלי שפה בסינית על כתיבה חופשית, סלנג ותיאורים אישיים לא פורמליים.

  • כוונון לכתיבת ארוטיקה

    ביצוע פיין-טיונינג למודלים שמיועדים ליצירת סיפורים ופנטזיות למבוגרים.

  • בדיקת מסנני תוכן

    בחינה והערכה של מערכות סינון שמיועדות לזהות תוכן מיני בוטה בסינית.

איפה זה נופל

כל הטקסט כתוב בסינית בלבד, בלי שום ייצוג לשפות אחרות ובלי עברית. היוצרים מזהירים שמדובר בתוכן למבוגרים שעלול להיות פוגעני או לא הולם, אך לא מפרטים הטיות ספציפיות, שנת איסוף מדויקת או שיטות בקרת איכות. מי שמפתח מוצר חייב לבדוק את התכנים בעצמו ולוודא שהשימוש בהם חוקי במדינה שבה הוא פועל, שכן היוצרים מסירים כל אחריות להשלכות של שימוש במאגר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון הוא CC-BY-NC 4.0 שמונע במפורש כל שימוש מסחרי. המאגר מוגדר למטרות מחקר בלבד, והיוצרים מציינים שהשימוש הוא באחריות המפתח. אם אתם בונים שירות בתשלום או כלי עסקי, החומר הזה לא מתאים לכם.

האם יש במאגר טקסטים בעברית או באנגלית?

הטקסטים כולם בסינית ואין במאגר עברית כלל. שמות הקבצים והתוכן הם בסינית, כאשר רק קובץ ההסבר תורגם לאנגלית. אם אתם מחפשים לאמן מודלים לשוק המקומי בישראל, תצטרכו לתרגם את החומר או לחפש מקור אחר.

מאיפה הגיעו הסיפורים ואיך הם נאספו?

כרטיס המאגר אינו מפרט את מקורות הנתונים המדויקים, למעט העובדה שמדובר בסיפורים קצרים ובחוויות אישיות. לא מצוין באילו אתרים אספו אותם או אם בוצע סינון כלשהו להסרת כפילויות ותוכן בעייתי. מומלץ לסרוק מדגם ידנית לפני שמזינים את החומר למודל.

באיזה פורמט שמורים הקבצים ואיך קוראים אותם?

האוסף מכיל 51 קובצי JSON נפרדים לפי נושאים, עם סך כולל של עשרות אלפי רשומות. כל קובץ בנוי כמערך פשוט של אובייקטים שבהם מפתח יחיד בשם text. טוענים אותם בקוד באמצעות ספריית JSON רגילה בקידוד utf-8 ללא צורך בספריות עיבוד מורכבות.

איך טוענים

אין כאן צורך בהרשאות מיוחדות או אישור גישה מוקדם, מורידים את הקבצים ישירות מהמאגר. הנתונים שמורים כקובצי JSON רגילים בקידוד utf-8, כך שאפשר לפתוח אותם בכל שפת תכנות עם פונקציית טעינה בסיסית. כל מה שצריך לחלץ מתוך המבנה הוא שדה הטקסט היחיד שנמצא בכל רשומה, ולהמשיך משם לעיבוד המקדים שדרוש לכם.

from datasets import load_dataset

ds = load_dataset("ystemsrx/Erotic_Literature_Collection")

הרישיון

הרישיון המדווח הוא CC-BY-NC 4.0. המשמעות היא שאסור להשתמש בנתונים למטרות מסחריות כלל, והם מיועדים למחקר בלבד. חובה לתת קרדיט ליוצר המאגר. מודל שאומן ישירות על החומר הזה נחשב לרוב יצירה נגזרת, ולכן אי אפשר לשלב אותו במוצר שמייצר הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗