GPT
F

flux-style-shaping

רץ בדפדפן

multimodalartmit2024-12-02

  • gradio

הכלי מייצר אשליות אופטיות והעברת סגנון מתמונות ומטקסט. הוא מתאים ליוצרים שרוצים לשלב מבנה גיאומטרי של תמונה אחת עם סגנון חזותי של תמונה אחרת.

  • הורדות בחודש
  • 903לייקים

מה זה

מזינים טקסט חופשי בתיבת הפרומפט, מעלים תמונה אחת שממנה נלקח המבנה הגולמי, ותמונה שנייה שממנה נלקח הסגנון החזותי. בצד המבנה קובעים את עוצמת העומק באמצעות סליידר שנע בין 0 ל־50, ובצד הסגנון קובעים את העוצמה בסליידר שבין 0 ל־1. התוצאה היא תמונה חדשה שמשלבת את שניהם.

מאחורי הקלעים רץ שילוב כבד של מודלים מבית Black Forest Labs שמופעלים דרך מנוע ComfyUI בקוד פייתון. המערך מחלץ מפת עומק מהתמונה המבנית בעזרת DepthAnythingV2 ומזין אותה לתוך FLUX.1-Depth-dev, במקביל לחילוץ מאפייני הסגנון באמצעות FLUX.1-Redux-dev ומודל SigLIP Vision. את הטקסט מפענחים מקודדי T5 ו־CLIP, ומשם הכל מתחבר לרינדור אחיד שמנסה לנעול את הצורה של התמונה הראשונה בתוך האסתטיקה של השנייה.

מתאים ל

  • יצירת אשליות אופטיות

    הטמעת צורות, דפוסים גיאומטריים או לוגואים ברקע של נופים וסצנות מורכבות.

  • העברת סגנון אומנותי

    שמירה על קומפוזיציה של צילום קיים תוך הלבשת פלטת צבעים וטקסטורה מציור.

  • בדיקת תהליכי ComfyUI

    התנסות מעשית בשילוב מודלי Redux ו־Depth של פלוקס ישירות בדפדפן בלי התקנה.

איפה זה נופל

זה לא עובד טוב כשמנסים לתת פרומפטים מורכבים בעברית, כי מקודדי הטקסט נשענים על אנגלית. בנוסף, מודל הרדוקס נוטה לפעמים לדרוס את המבנה של מפת העומק אם סליידר הסגנון גבוה מדי. כדאי לזכור שחומרת A10 אחת מתמודדת פה עם צינור שמכיל שמונה מודלים שונים, כך שתחת עומס משתמשים ייתכנו זמני המתנה ארוכים או קריסות של הקצאת זיכרון.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

הגישה פתוחה וחינמית בדפדפן דרך תשתית Hugging Face Spaces. אין צורך בהזנת אמצעי תשלום, אך זמינות השרת תלויה בהקצאת המשאבים הציבורית.

כמה זמן לוקח לכל תמונה להיווצר?

הדוגמאות המובנות מוצגות מיד כי הן נשמרות במטמון. יצירה חדשה מאפס עשויה לקחת בין כמה עשרות שניות לכמה דקות, בעיקר אם השרת צריך להתעורר ולהעלות את המודלים.

אפשר להריץ את זה באופן מקומי?

כן, הקוד מבוסס על תהליך עבודה גלוי של ComfyUI שפורסם בגיטהאב. כדי להריץ אותו במחשב תצטרכו כרטיס מסך חזק עם זיכרון וידאו משמעותי כדי להחזיק את כל המודלים במקביל.

במה הכלי שונה משימוש רגיל ב־FLUX?

הוא אינו מסתפק בטקסט בלבד, אלא כובל את התוצאה למפת עומק מתמונה אחת ולניתוח חזותי מתמונה שנייה בו-זמנית. זה מאפשר שליטה מבנית שאפשר להשיג רק בשילוב מודלים ייעודיים.

איך משתמשים

לוחצים על כפתור Generate אחרי הזנת הפרומפט והתמונות, או בוחרים באחת הדוגמאות המוכנות מראש ששמורות במטמון כדי לקבל תוצאה מיידית. ההרצה מתבצעת על חומרת zero-a10g, מה שאומר שהמעבד הגרפי מוקצה לפי דרישה. אם הכלי היה כבוי, תצטרכו להמתין לעליית המכונה ולטעינת המשקלים העצומים של פלוקס לזיכרון לפני שהיצירה מתחילה בפועל.

הרישיון

קוד הממשק מוגדר תחת רישיון MIT המתירני, אך המודלים המרכזיים שרצים בפנים הם FLUX.1-dev של Black Forest Labs, הכפופים לתנאי הרישיון הלא-מסחרי של החברה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗