GPT
I

improved-flux-prompts-photoreal-portrait

קוד פתוח

k-mktrmit2024-09-28

  • art

המאגר כולל עשרות אלפי פרומפטים ממוקדים ליצירת פורטרטים פוטו-ריאליסטיים במודל FLUX.1. הוא חוסך שעות של הנדסת פרומפטים עבור מי שמחפש תוצאות אנושיות מדויקות בלי להתחיל מאפס.

  • 574הורדות בחודש
  • 115לייקים

מה זה

מדובר באוסף פרומפטים באנגלית שמיועדים במקור לייצור פורטרטים מציאותיים. התהליך התחיל מאיסוף פרומפטים מובילים ממקורות שונים, כולל קהילת רדיט של פלאקס, ולאחר מכן הרחבה ושכתוב שלהם באמצעות מודל השפה Hermes 3. המטרה היתה להתאים את הניסוחים ספציפית למבנה שמניב תוצאות טובות ב־FLUX.1, עם דגש על מונחי צילום מקצועיים במקום תיאורים אמנותיים כלליים.

המבנה של כל רשומה פשוט לחלוטין. קובץ ה־JSONL המרכזי מכיל שני שדות בלבד לכל שורה: מזהה ייחודי והטקסט המלא של הפרומפט. הטקסטים עצמם מפורטים מאוד וכוללים הוראות על תאורה, תנוחה, מרקם עור, צבע ועיצוב שיער, רקע וסגנון המצלמה. המאגר עודכן באוקטובר 2024 כדי להסיר ביטויים שחזרו על עצמם יותר מדי, לגוון מוצאים אתניים ולהוסיף אפקטים כמו חשיפה כפולה.

מתאים ל

  • אימון מודלי שפה לפרומפטים

    פיין-טיונינג למודלי טקסט כדי שיידעו להרחיב תיאור קצר לפרומפט צילומי עשיר ומפורט.

  • הערכת ביצועי מודלי תמונה

    הרצת סט בדיקה אחיד על גרסאות שונות של מודלי תמונה לבדיקת איכות יצירת פנים ואנטומיה.

  • יצירת מאגרי תמונות סינתטיים

    ייצור אוטומטי של תמונות פורטרט מגוונות לצורכי בדיקות ממשק, גרפיקה או מחקר ראייה ממוחשבת.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין פה תמיכה בשפות אחרות. מעבר לכך, היוצרים מציינים במפורש שעדיין קיימות חוסר עקביות בין פרומפטים שונים, למרות הניקוי הידני והשימוש ב־LLM. בעיה מרכזית נוספת שמצוינת בדף היא נטייה של המודל לייצר פנים נשיות דומות מדי זו לזו, מה שדורש שימוש ברכיבי LoRA חיצוניים כדי לקבל גיוון אמיתי בתווי הפנים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר פורסם תחת רישיון MIT שמתיר שימוש מסחרי ללא תמלוגים. אתם יכולים לאמן עליו מודלים, לייצר בעזרתו תמונות למכירה או לשלב אותו במערכות פנימיות. הדרישה היחידה היא השארת הקרדיט וטקסט הרישיון המקורי.

האם יש במאגר תמיכה בעברית?

לא, כל הפרומפטים מנוסחים באנגלית בלבד. אם המוצר שלכם מקבל קלט בעברית, תצטרכו להוסיף שכבת תרגום או התאמה לפני השליחה למודל התמונה. מונחי הצילום והתאורה מותאמים ישירות לטרמינולוגיה המקובלת באנגלית.

איך נוצרו הפרומפטים במאגר?

הבסיס נאסף מקהילות רשת ומשתמשי FLUX, ובראשם רדיט. הפרומפטים האלו עברו עיבוד והרחבה על ידי מודל השפה Hermes 3 בהתאם להנחיות מערכת קפדניות ששמות דגש על שפה צילומית. לאחר מכן נעשה ניקוי ידני שכלל הסרת מונחים שחזרו על עצמם והוספת סגנונות חדשים.

האם המאגר כולל תמונות מוכנות או רק טקסט?

המאגר מורכב בעיקרו מטקסט בפורמט JSONL. קיימות במאגר מספר תמונות דוגמה בפורמט webp שנועדו להמחיש את התוצאות מול ה־id של הפרומפט, אבל זה אינו מאגר תמונות רחב לאימון ראייה ממוחשבת אלא מאגר טקסט בלבד.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets או בקריאת קובץ ה־JSONL הרלוונטי מתוך המאגר, שכולל 18 קבצים בסך הכל יחד עם תמונות דוגמה. אין צורך בבקשת גישה מיוחדת או אישור מיוצר המאגר, הכל פתוח להורדה מיידית. שני השדות היחידים שקיימים ברשומות הם id ו־prompt, כך שאין צורך בסינון מורכב של מטא-דאטה.

from datasets import load_dataset

ds = load_dataset("k-mktr/improved-flux-prompts-photoreal-portrait")

הרישיון

המאגר מופץ תחת רישיון MIT. המשמעות היא חופש פעולה כמעט מלא: מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, לאמן עליו מודלים ולשלב אותו במוצרים סגורים. הדרישה היחידה היא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗