GPT
U

USO

קוד פתוח

bytedance-researchapache-2.02025-08-27

  • diffusers
  • image-generation
  • subject-personalization
  • style-transfer
  • Diffusion-Transformer

המודל הזה משלב תמונה של אובייקט ותמונה של סגנון כדי ליצור תמונה חדשה ששומרת על שניהם במקביל. הוא מיועד למי שצריך התאמה אישית של תוכן בלי לאבד את הדמות או את המראה הוויזואלי.

  • 478 MBמשקל הקבצים
  • 228הורדות בחודש
  • 191לייקים

מה זה

בדרך כלל יצירת תמונות מותאמת אישית נאלצת לבחור בין שמירה מדויקת על האובייקט לבין העתקת הסגנון, ושני הצרכים האלה מתנגשים. המערכת הזו מתייחסת לשניהם כמשימה אחת של פירוק והרכבה מחדש של תוכן וסגנון. החוקרים השתמשו במאגר של שלשות תמונות שכולל תוכן, סגנון ותוצאה משולבת, לצד מנגנון למידה מבוסס תגמול סגנוני כדי לחזק את התוצאות.

לפי המדידות במבחן ההשוואה USO-Bench שהחוקרים פיתחו, המודל מציג ביצועים מובילים מבין מודלי הקוד הפתוח בשני המדדים במקביל. זה אומר שלא מקבלים כאן סגנון טוב על חשבון עיוות הדמות, או דמות מדויקת שמתעלמת מהשפה העיצובית של תמונת הרפרנס.

מתאים ל

  • הלבשת סגנון על דמות קיימת

    הוא לוקח תמונת אובייקט ותמונת סגנון וממזג אותן בלי לאבד את תווי הפנים או המבנה.

  • יצירת שפה עיצובית עקבית

    מתאים למי שרוצה לייצר סדרת תמונות שונות שנשענות על אותו רפרנס אמנותי בדיוק.

  • מחקר של פירוק תוכן וסגנון

    הפרויקט כולל מדד השוואה ייעודי לבחינת נאמנות לאובייקט מול דמיון לסגנון.

איפה זה נופל

הקוד והמשקלים כאן לא עושים כלום לבד ותלויים לחלוטין במודל הבסיס FLUX.1 dev. מעבר לזה, המודל מוגדר ומאומן באנגלית בלבד, כך שהנחיות טקסט בעברית לא יעבדו בצורה ישירה. כמו כן, החוקרים מציינים שהפרויקט שוחרר למטרות מחקר אקדמי, כך שחובת הבדיקה על התנהגות המודל במקרי קצה ותרחישי ייצור חלה עליכם.

שאלות
נפוצות

האם הקבצים ששוקלים 478 מגה בייט מספיקים כדי לייצר תמונות?

לא. מדובר בקובצי LoRA ומקרן בלבד, וכדי לייצר תמונה צריך להוריד בנפרד את מודל הבסיס FLUX.1 dev ואת מקודדי הטקסט.

האם אפשר להשתמש במודל הזה ישירות באפליקציה מסחרית?

המתאם עצמו מוגן ברישיון קוד פתוח מתירני, אבל הוא תלוי ברישיון של מודל הבסיס FLUX.1 dev שמגביל שימוש מסחרי.

איך מריצים

המשקל הכולל של הקבצים עומד על 478 מגה בייט בלבד, אבל זה לא מודל עצמאי אלא מתאם שמתלבש על מודל בסיס. כדי להריץ אותו בפועל חייבים להוריד ולהגדיר מראש את FLUX.1 dev יחד עם רכיבי T5, CLIP ומקודד האוטואנקודר, ואז לטעון את משקלי ה־LoRA והמקרן של הפרויקט. הריצה נתמכת בסביבת פייתון בין גרסה 3.10 לגרסה 3.12 דרך ספריית diffusers.

מי שאין לו תשתית מוכנה עם כרטיסי מסך חזקים שמסוגלים להחזיק את מודל הבסיס הגדול, יתקשה להריץ את זה מקומית. במצב כזה, פנייה לשירות ענן שמחזיק מודלי בסיס כאלה מוכנים תהיה פשוטה בהרבה מהתקנה ותחזוקה של כל שרשרת הרכיבים מאפס.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("bytedance-research/USO")
img = pipe("a photo").images[0]

הקבצים

7 קבצים במאגר, 478 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט עצמו מפורסם תחת רישיון apache-2.0, שמאפשר שימוש חופשי ושינוי קוד. עם זאת, היוצרים מדגישים שאם משתמשים במודלי בסיס אחרים, חייבים לציית לתנאי הרישיון המקוריים שלהם. במקרה הזה, שימוש מסחרי מוגבל בגלל תנאי השימוש של מודל הבסיס שעליו המתאם רץ.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗