GPT
M

midjourney-prompts

קוד פתוח

succinctlyapache-2.02022-07-21

אוסף של טקסטים ממשתמשי מידג'רני שנועד לאימון מודלי שפה על יצירת פרומפטים לתמונות. הוא חוסך מכם גירוד עצמאי של דיסקורד כשאתם בונים מחולל הנחיות.

  • 358הורדות בחודש
  • 109לייקים

מה זה

המאגר כולל פרומפטים טקסטואליים בלבד שנלקחו מתוך שרת הדיסקורד הציבורי של מידג'רני. המקור הראשוני הוא סט גולמי שפורסם בקגל ומכיל 250 אלף הודעות דיסקורד יחד עם התמונות שנוצרו, אבל הגרסה הזו עברה עיבוד ומחקה את כל מה שמסביב. אין פה תמונות, אין מזהי משתמשים ואין מטא-דאטה של ההודעות, רק מחרוזות הטקסט שהאנשים הקלידו לבוט.

הנתונים מחולקים מראש לשלושה חלקים מוכנים לעבודה: סט אימון, סט בדיקה וסט ולידציה. מי שיצר את האוסף מציין בפירוש שאין לו שום קשר רשמי לחברת מידג'רני, ומדובר בתוצר ישיר של גירוד השיחות הציבוריות.

מתאים ל

  • אימון מחולל פרומפטים

    כוונון עדין של מודלי שפה קטנים כדי שישלימו או ייצרו הנחיות עשירות ליצירת תמונות.

  • השלמה אוטומטית בממשק

    שילוב הנתונים במערכת שמציעה למשתמשים מילות תיאור וסגנונות בזמן שהם מקלידים.

  • ניתוח העדפות משתמשים

    בדיקת מבנה ההנחיות והנושאים הנפוצים ביותר שאנשים ביקשו לייצר בתחילת דרכו של הכלי.

איפה זה נופל

הטקסטים נאספו בקיץ 2022, בתקופה מוקדמת מאוד של מידג'רני, ולכן הם מייצגים את סגנון הכתיבה והפרמטרים שהיו נהוגים אז ולא את היכולות הנוכחיות. הכרטיס לא מציין סינון של תוכן פוגעני, זכויות יוצרים של שמות אמנים שהוקלדו, או בדיקת שפות, כך שסביר להניח שרובו המוחלט באנגלית. אם אתם בונים משהו שנועד לעבוד בעברית או מול מודלי תמונה מודרניים, תצטרכו לנקות ולבדוק את הנתונים בעצמכם.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

הרישיון המדווח בעמוד הוא apache-2.0, שמאפשר שימוש מסחרי חופשי בקבצים עצמם. עם זאת, הנתונים הם גירוד של הודעות משתמשים משרת ציבורי וללא שיוך רשמי לחברה שיצרה את הכלי. אם אתם מאמנים מודל מסחרי, כדאי לקחת בחשבון את שאלת המקור של הטקסטים.

האם הדאטהסט כולל תמונות שנוצרו?

לא, הגרסה הזו כוללת אך ורק את מחרוזות הטקסט של הפרומפטים שנשלחו לבוט. התמונות וכל שאר המטא-דאטה הוסרו בתהליך העיבוד ונשארו רק בקובץ הגולמי המקורי שנמצא בקגל. זה חוסך המון מקום בדיסק ומתאים בדיוק לאימון מודלי שפה.

האם יש בדאטהסט פרומפטים בעברית?

הכרטיס אינו מדווח על תמיכה בשפות נוספות מעבר למה שהוקלד בדיסקורד בפועל. מכיוון שרוב המשתמשים בשרת כתבו באנגלית, הדאטהסט מורכב כמעט כולו מטקסט באנגלית. אם תמצאו שם עברית, זה יהיה במקרה ובכמויות זניחות שלא יספיקו לאימון רציני.

מאיפה הנתונים האלה הגיעו ואיך הם נאספו?

היוצרים אספו 250 אלף הודעות ישירות משרת הדיסקורד הפתוח של מידג'רני בשנת 2022. לאחר הגירוד הראשוני הם ניקו את ההודעות והשאירו רק את הטקסט הנקי של ההנחיות, אותו פיצלו לסט אימון, בדיקה וולידציה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה succinctly/midjourney-prompts, בלי צורך לבקש אישור גישה מוקדם או להמתין למפתח. המידע מחולק לקובצי parquet סטנדרטיים של train, test ו־validation, כך שהקריאה שלהם מתבצעת מהר וישר לתוך הזיכרון. במאגר יש בסך הכל שישה קבצים, כולל הגדרות המבנה. מאחר שהסירו מהם את התמונות והשאירו רק את שדות הטקסט של הפרומפטים עצמם, נפח ההורדה קטן ולא דורש תשתית אחסון כבדה.

from datasets import load_dataset

ds = load_dataset("succinctly/midjourney-prompts")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים, בתנאי ששומרים על הודעת הרישיון והקרדיט. הרישיון לא מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון בדיוק. עם זאת, קחו בחשבון שהטקסטים עצמם גורדו מדיסקורד ללא אישור ישיר מכותבי הפרומפטים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗