GPT
R

Reddit-Dirty-And-WritingPrompts

קוד פתוח

nothingiisrealapache-2.02024-07-15

  • not-for-all-audiences

טקסטים שנכתבו על ידי אנשים אמיתיים ברדיט בתגובה לאתגרי כתיבה, עם שילוב בין תכנים רגילים למבוגרים בלבד. המטרה היא להוציא מודלים מהתבניות היבשות ולהכניס שונות בסגנון ובשפה.

  • 264הורדות בחודש
  • 67לייקים

מה זה

המאגר מחולק לשני קובצי JSONL עיקריים לפי מקור הנתונים. קובץ אחד מגיע מתת הרדיט r/WritingPrompts והשני מגיע מגרסת המבוגרים r/DirtyWritingPrompts, שניהם נחתכו מתוך מאגר רחב יותר של רדיט. לפי ההערכה יש כאן מעל מאה אלף שורות בנפח של 1.4 גיגה בייט.

כל רשומה כוללת את אתגר הכתיבה, את התגובה שנכתבה עבורו, ואת הניקוד שההודעה קיבלה מהגולשים. הטקסטים שומרים על התגיות המקוריות של הפורומים, כמו הנחיות לסגנון תסריט או עולמות בדיוניים קיימים.

הסינון המדווח כולל הסרה של תגובות קצרות מ־400 תווים, שהוגדרו כספאם או כחסרות ערך. בנוסף נמחקו תכנים שהכילו מחרוזות טקסט אסורות שהוגדרו בתהליך הניקוי.

מתאים ל

  • אימון לכתיבה יצירתית

    יצירת מודלים שמסוגלים לכתוב סיפורים עם מבנה משפטים עשיר יותר ומגוון דמויות, בלי הנוסחתיות הרגילה.

  • פיתוח סוכני שיחה

    חשיפת מודלים לשפה יומיומית של בני אדם, כדי להפוך שיחות לטבעיות ופחות רובוטיות.

  • סינון והתאמת תוכן למבוגרים

    אימון מודלים לזיהוי, סיווג או הפקה של תוכן עלילתי שמיועד למבוגרים בלבד מתוך הקובץ הייעודי.

איפה זה נופל

התוכן מבוסס כולו על קהילות רדיט באנגלית, ואין פה מילה בעברית. חלק משמעותי מכיל תוכן בוטה או מיני מפורש, כך שלא תוכלו לזרוק את זה למודל שמיועד למוצר ארגוני בלי סינון אגרסיבי. חלק מהתגובות נשענות על עולמות תוכן מוגנים בזכויות יוצרים, כמו סרטים וספרים מוכרים. מעבר לזה, הכרטיס לא מפרט אילו מחרוזות טקסט נפסלו בתהליך הסינון, כך שאי אפשר לדעת בדיוק מה הוצא החוצה.

שאלות
נפוצות

האם מותר להשתמש בזה למטרות מסחריות?

כן, הרישיון המדווח הוא apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ובלבד שמצרפים את הרישיון המקורי ואת הודעת הייחוס.

האם יש בדאטהסט הזה תוכן בעברית?

לא. הנתונים נאספו מקהילות רדיט שכותבות באנגלית בלבד. אם אתם מחפשים לשפר ביצועים בעברית, המאגר הזה לא ייתן לכם מענה ישיר בלי תרגום או התאמה.

במה הוא שונה ממאגרי פרומפטים אחרים ברשת?

החומרים כאן נכתבו בידי בני אדם ולא סונתזו על ידי מודלים אחרים, מה שמביא יותר גיוון בשפה. בנוסף, הוא כולל חלק שלם של תכנים למבוגרים בלבד, ומציע נפח גדול פי מאה ממאגרים סינתטיים מקבילים שקיימים בתחום.

כמה המאגר שוקל ואיך הוא בנוי?

המשקל הכולל עומד על כ־1.4 גיגה בייט, עם הערכה של מעל מאה אלף רשומות. הוא מופרד לשני קובצי JSONL, אחד לתוכן רגיל והשני לתוכן למבוגרים, לצד קובץ תיעוד.

איך טוענים

אין צורך בבקשת גישה מיוחדת, הקבצים פתוחים להורדה ישירה מתוך המאגר. מדובר בקובצי jsonl שאפשר לטעון ישירות לזיכרון בלי להזדקק לתשתיות כבדות. השדות שמעניינים אתכם בפנים הם הטקסט של הפרומפט, הטקסט של התגובה, והציון שמשקף את הפופולריות שלה. שימו לב לתגיות בתוך הפרומפטים, תצטרכו להחליט מראש אם לנקות אותן או להשתמש בהן כדי לסנן ז'אנרים.

from datasets import load_dataset

ds = load_dataset("nothingiisreal/Reddit-Dirty-And-WritingPrompts")

הרישיון

המאגר מפורסם ברישיון apache-2.0, שמאפשר שימוש חופשי ושינוי, כולל לצרכים מסחריים, כל עוד שומרים על הקרדיט והודעת הרישיון. המשמעות היא שאין מניעה חוקית לפי הרישיון המוצהר לאמן מודלים על החומרים האלה, גם אם המודל הסופי מיועד למכירה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗