GPT
F

FLUX.1-dev-with-Captioner

רץ בדפדפן

gokaygokayapache-2.02024-07-02

  • gradio

הכלי מייצר תמונות חדשות מתוך תמונה קיימת או טקסט, בעזרת שילוב של שלושה מודלים שונים. הוא מתאים למי שרוצה לשחזר סגנון מתמונה בלי לכתוב תיאור מורכב בעצמו.

  • הורדות בחודש
  • 131לייקים

מה זה

אתם מעלים תמונה כדי שהמערכת תנתח אותה, או כותבים תיאור טקסטואלי ישיר אם אין לכם קובץ להעלות. כשמעלים תמונה, המודל Florence-2-base של מיקרוסופט מייצר לה תיאור מילולי מפורט. אם אתם בוחרים להפעיל את מנגנון ההרחבה, מודל בשם Lamini-Prompt-Enchance-Long לוקח את התיאור הזה או את הטקסט שכתבתם, ומשכתב אותו כדי להוסיף פרטים ועומק.

בסוף התהליך, הטקסט המעובד נשלח למודל FLUX.1-dev של חברת Black Forest Labs. המודל מייצר תמונה חדשה לגמרי בגודל שקבעתם, מברירת מחדל של 1024 על 1024 פיקסלים ועד גדלים מותאמים. בפלט אתם מקבלים את התמונה שנוצרה, את הפרומפט הסופי שבו המערכת השתמשה בפועל, ואת מספר הסיד המדויק שנבחר להרצה.

מתאים ל

  • שחזור תמונה בסגנון אחר

    מעלים תמונה קיימת, נותנים למודל לחלץ תיאור מילולי, ומייצרים אותה מחדש דרך FLUX.

  • הרחבת פרומפטים קצרים

    מקלידים תיאור של מילים בודדות ומסמנים שימוש במרחיב כדי לקבל פרומפט עשיר אוטומטית.

  • הפקת תמונות לפי הגדרות

    שולטים במידות התמונה, בכמות צעדי הריצה וב־guidance scale להשגת תוצאה מדויקת.

איפה זה נופל

אם תעלו תמונה וגם תכתבו טקסט, הקוד יתעלם לחלוטין מהטקסט שלכם ויתבסס רק על מה ש־Florence-2 מבין מהתמונה. בנוסף, מודל הרחבת הטקסט נוטה להמציא פרטים שלא קיימים בתמונה המקורית. אם מפעילים אותו, התוצאה הסופית עלולה לסטות משמעותית מהמקור מבחינת קומפוזיציה ותוכן.

שאלות
נפוצות

האם השימוש עולה כסף?

לא, השימוש בדף עצמו פתוח בחינם. הוא מוגש על תשתית שיתופית ולכן אין צורך בתשלום כדי להריץ בדיקות.

מה קורה אם מעלים גם תמונה וגם כותבים פרומפט?

הקוד בנוי כך שהתמונה מקבלת עדיפות מוחלטת. הטקסט הידני שלכם מופעל אך ורק אם לא העליתם שום קובץ.

האם אפשר להריץ את זה על המחשב בבית?

כן, הקוד מבוסס על ספריות סטנדרטיות כמו diffusers ו־transformers. עם זאת, תצטרכו כרטיס מסך חזק כדי להחזיק את שלושת המודלים בזיכרון בו זמנית.

במה הדף הזה שונה מהרצה רגילה של FLUX?

הוא מחבר שרשרת שלמה של כלים במקום אחד. במקום שתכתבו פרומפט מפורט בעצמכם, מודל ראייה מפענח את התמונה ומודל שפה מרחיב את התיאור לפני היצירה.

איך משתמשים

לוחצים על Generate Image ומחכים. הריצה מתבצעת על חומרת zero-a10g של האתר, שמשתפת משאבי עיבוד ומקצה מעבד גרפי לפי דרישה. ברירת המחדל עומדת על 28 צעדי יצירה עם יחס גיידנס של 3.5, מה שאומר שהתהליך לוקח כמה עשרות שניות בודדות אם אין תור של משתמשים אחרים באותו רגע.

הרישיון

הקוד בדף מפורסם ברישיון apache-2.0, אבל הוא מריץ את FLUX.1-dev שדורש טוקן גישה ייעודי וכולל תנאי שימוש נפרדים ומגבילים של חברת Black Forest Labs. לא מפורט מה קורה עם התמונות שאתם מעלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗