GPT
O

Opus-WritingPrompts

קוד פתוח

Grypheunknown2024-05-24

  • synthetic
  • not-for-all-audiences

המאגר מרכז מעל 3,000 סיפורים קצרים שנכתבו על ידי קלוד אופוס בהשראת רדיט. מי שבונה מודלים לכתיבה יצירתית ימצא פה טקסטים ארוכים ועשירים, כולל תוכן ללא מעצורים.

  • 4,041הורדות בחודש
  • 85לייקים

מה זה

הנתונים נשענים על פרומפטים מקהילת WritingPrompts ברדיט. המחבר הריץ אותם מול קלוד אופוס ללא מגבלות תוכן, ניקה את הטקסטים שהתקבלו, והוסיף לכל סיפור כותרת ותיוג ז'אנרים תואם. רוב הסיפורים נעים בין 4,000 ל־6,000 תווים, כך שמדובר בטקסטים רציפים ולא בתשובות קצרות.

במאגר יש שבעה קבצים, והם מחולקים לשני פורמטים עיקריים. יש גרסת ShareGPT שמוכנה ישר לאימון שיחתי, וגרסת גלם עם עמודות מסודרות לפרומפט, כותרת, ז'אנר והסיפור עצמו. בהמשך נוספו סט נוסף מאופוס לאותם פרומפטים וקובץ מקביל שנוצר באמצעות GPT 3.5, שמיועד לשמש כדוגמאות שליליות עבור אימוני העדפה מסוג KTO.

מתאים ל

  • אימון לכתיבה יוצרת

    כיוונון מודלים ליצירת סיפורים עלילתיים ארוכים עם סגנון עשיר יותר מתשובות צ'אט רגילות.

  • אימוני העדפה KTO

    שימוש בזוגות הסיפורים של אופוס מול גרסת GPT 3.5 כדי ללמד מודל לזהות כתיבה איכותית.

  • מיון טקסט לפי ז'אנר

    בניית מדרגים ומסווגים על בסיס התיוגים והכותרות שנוספו לסיפורי הגלם.

איפה זה נופל

הטקסטים כולם באנגלית ואין כאן מילה בעברית. המחבר מזהיר במפורש שהדאטהסט מכיל תוכן ארוטי, ובהיותו תוצר של מודל ללא ריסון, הוא עלול לכלול חומרים שלא מתאימים לכל מטרה. בנוסף, מדובר בטקסט סינתטי לחלוטין שמבוסס על רדיט, כך שיש לו הטיות סגנוניות ברורות שדורשות סינון לפני שילוב במערכת מסחרית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר מוגדר כ־unknown, ולכן אין היתר שימוש ברור. בנוסף, הטקסטים נוצרו על ידי מודלים של חברות מסחריות, מה שיוצר סיכון משפטי נוסף. מומלץ להימנע משימוש בו במוצרים מסחריים ולהגביל אותו למחקר.

האם יש בדאטהסט תמיכה בעברית?

אין במאגר עברית בכלל. כל הרשומות, הפרומפטים והסיפורים נוצרו באנגלית בלבד. אם המטרה שלכם היא מודל שמייצר תוכן בעברית, המאגר הזה לא יקדם אתכם.

איך נאסף המידע ומה הוא כולל?

הפרומפטים נלקחו מתת האתר WritingPrompts ברדיט. לאחר מכן קלוד אופוס ייצר את הסיפורים, והם עברו ניקוי ידני, מתן כותרות ותיוג ז'אנרים. בהמשך נוסף גם סט מקביל שנוצר באמצעות GPT 3.5 עבור אותם רעיונות.

באיזה פורמט הקבצים מגיעים?

המאגר מכיל קובצי JSONL בכמה תצורות שונות. תמצאו שם קבצים מוכנים במבנה של ShareGPT לכוונון מודלי שיחה, לצד קובצי raw הכוללים עמודות נפרדות לפרומפט, לז'אנר, לכותרת ולסיפור.

איך טוענים

טוענים את הקבצים ישירות מהמאגר בעזרת ספריית datasets או כקובצי JSONL מקומיים. המאגר פתוח לציבור ואין צורך בבקשת גישה מיוחדת. אם אתם מכוונים לאימון סטנדרטי, קובצי ה־ShareGPT יחסכו לכם עיבוד. אם אתם צריכים סינון לפי ז'אנרים או כותרות, תעבדו עם גרסאות ה־raw ובדקו את השדות prompt, title, genre ו־story.

from datasets import load_dataset

ds = load_dataset("Gryphe/Opus-WritingPrompts")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות פשוטה, אין אישור רשמי לשימוש מסחרי, ואי אפשר לדעת אם מותר להפיץ מודל שאומן עליו בלי להסתכן. תוסיפו לזה את תנאי השימוש של ספקי המודלים שייצרו את הדאטה, ותקבלו חומר שמתאים בעיקר לניסויים ומחקר עצמאי.

הרישיון המלא ב־Hugging Face ↗