GPT
M

midjourney-v5-202304-clean

קוד פתוח

wanngapache-2.02023-05-26

  • midjourney

מאגר לא רשמי של פרומפטים ותמונות שנקצרו ממידג'רני באפריל 2023. הוא מתאים למי שרוצה ללמוד איך אנשים מתארים תמונות או לאמן מודלים על תוצרים שנבחרו להגדלה.

  • 128הורדות בחודש
  • 90לייקים

מה זה

המאגר מבוסס על פרויקט מקורי של tarungupta83 ומכיל 1,701,420 זוגות של פרומפטים ותמונות מגרסה 5 של מידג'רני. המפרסם ביצע ניקוי מסוים של הנתונים וחילק את המידע לשני קבצי parquet נפרדים לפי סוג התוצר.

הקובץ הראשון, ori_prompts_df.parquet, כולל 1,255,812 רשומות של תמונות הגריד המקוריות, אותן רביעיות ראשוניות שהמערכת מחזירה בתגובה לבקשה. הקובץ השני, upscaled_prompts_df.parquet, מכיל 445,608 זוגות של תמונות שעברו הגדלה באמצעות פקודת upscale. החלוקה הזו מציעה סינון מובנה לפי העדפת משתמשים, בהנחה שמשתמש מגדיל רק תוצאה שקלעה לטעמו מתוך הארבע.

התוכן עצמו משקף יצירות משתמשים טיפוסיות באנגלית ובצרפתית מחודש בודד באביב 2023. התיעוד לא מפרט אילו פעולות ניקוי טכניות בוצעו מעבר לחלוקה הזו, כך שכדאי לקחת בחשבון שהמידע ברשומות מבוסס על שאיבה ישירה של דיסקורד ללא סינון איכות מעמיק יותר.

מתאים ל

  • אימון מודלי טקסט לתמונה

    שימוש בזוגות של פרומפט ותמונה מוגדלת כדי לכוונן מודל על העדפות אסתטיות של משתמשים.

  • חקר שפת פרומפטים

    ניתוח מילים וביטויים נפוצים באנגלית ובצרפתית שמביאים לתוצאות מוצלחות במידג'רני.

  • אימון מודלי כיתוב תמונה

    לימוד מודל לתאר תמונות מורכבות על בסיס הפרומפטים המפורטים ששימשו ליצירתן.

איפה זה נופל

כל המידע נאסף בחודש אחד בלבד, אפריל 2023, ומייצג אך ורק את גרסה 5 של מידג'רני. השפות המדווחות הן אנגלית וצרפתית, כך שאין כאן שום כיסוי לעברית. מעבר לכך, התיעוד דל מאוד ולא מפרט באילו שיטות בוצע הניקוי, האם הוסר תוכן פוגעני או כפילויות, ולכן חובה לסנן את הטקסטים והתמונות עצמאית לפני שמשלבים אותם בכל פרויקט אמיתי.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

לא. השפות המוגדרות במאגר הן אנגלית וצרפתית בלבד. הטקסטים משקפים את הפרומפטים שנשלחו על ידי משתמשי מידג'רני בעולם בשפות אלו.

מאיפה הנתונים הגיעו בפועל?

הנתונים נקצרו ממידג'רני באפריל 2023. הם מתבססים על מאגר קודם של המשתמש tarungupta83, ועברו חלוקה וניקוי על ידי wanng.

מה ההבדל בין שני הקבצים במאגר?

קובץ אחד מכיל את רביעיות התמונות המקוריות מההרצה הראשונה של הפרומפט. הקובץ השני מכיל רק תמונות שמשתמשים בחרו להגדיל, מה שמעיד על איכות או שביעות רצון גבוהה יותר מהתוצאה.

האם מותר להשתמש בו למוצר מסחרי?

רישיון המאגר המדווח הוא apache-2.0 שמתיר שימוש מסחרי. יחד עם זאת, מדובר בקצירה לא רשמית מתוך מידג'רני, ולכן כדאי לבחון היטב את תנאי השימוש של שירות המקור לפני שמשלבים את המידע במוצר.

איך טוענים

טוענים את הקבצים ישירות באמצעות ספריית datasets או קוראים את קבצי ה־parquet עם pandas. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה. הוא מחולק לשני קבצים עיקריים שמרכזים את התמונות הראשוניות ואת התמונות המוגדלות לצד הפרומפטים שלהן. לפני שמתחילים כדאי לשים לב שמדובר בקבצים גדולים שמכילים מאות אלפי שורות, אז עדיף לטעון מדגם קטן ולבדוק את מבנה העמודות לפני שמושכים את הכל לזיכרון.

from datasets import load_dataset

ds = load_dataset("wanng/midjourney-v5-202304-clean")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים את הרישיון המקורי. עם זאת, התוכן עצמו נאסף באופן לא רשמי משרתי מידג'רני, ולכן עשויות לחול עליו מגבלות שימוש של הפלטפורמה המקורית ושל זכויות היוצרים על התמונות עצמן, נקודה שחשוב לבדוק משפטית לפני שמפיצים מודל שאומן עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗