GPT
I

In-Context-LoRA

קוד פתוח

ali-vilabmit2024-11-07

  • diffusers
  • text-to-image
  • lora

הפרויקט הזה מביא עשרה מתאמי LoRA מבוססי FLUX שמייצרים סטים מחוברים של תמונות, כמו סטוריבורד או מיתוג, בתוך פריים בודד ועל פי טקסט רגיל.

  • 1.6 GBמשקל הקבצים
  • 1,482הורדות בחודש
  • 636לייקים

מה זה

הרעיון הטכני כאן פשוט אך יעיל, במקום לייצר תמונות נפרדות ולנסות לחבר ביניהן, המודלים האלה משרשרים תמונת מקור ויעד לתוך תמונה מורכבת אחת. השליטה על המעברים, חלוקת הפאנלים וההקשר העיצובי מתבצעת ישירות דרך פרומפט בשפה טבעית, תוך שימוש בתגיות מיקום כמו שמאל וימין או חלוקה לארבעה ריבועים.

המאגר כולל עשרה מתאמים ייעודיים שנבנו עבור משימות שונות, ביניהן יצירת סטוריבורד קולנועי, עיצוב פונטים, עיצוב פנים, והדמיית מיתוג על מוצרים. הקהילה כבר פיתחה סביבם צמתים ל־ComfyUI ושימושים של העברת בגדים ומעבר בין איור לריאליזם, כך שלא מדובר רק בניסוי תיאורטי אלא בתשתית עבודה מוכנה ליישום.

מתאים ל

  • הפקת סטוריבורד לסרטים

    יצירת רצף של שלושה שוטים עלילתיים עקביים בפריים יחיד של 1024 על 1536 פיקסלים.

  • הדמיית מיתוג ומוצרים

    תרגום לוגו ועיצוב שטוח להדמיה על גבי תיק קניות או מוצר פיזי בהרצה אחת.

  • עימוד שקפים ומצגות

    ייצור תבנית של ארבעה פאנלים מותאמים אישית לחלוקת תוכן, תמונות ופרופילי מרצים.

איפה זה נופל

זהו אינו כלי קסם שמבין כל בקשה עיצובית באופן חופשי. לפי מבחן IDEA-Bench שהחוקרים פרסמו, משימות עיצוב בעולם האמיתי ללא אימון מוקדם מגיעות לציונים נמוכים במיוחד, כאשר המודל המוביל במבחן קיבל ציון של 6.81 מתוך 100 בלבד.

בנוסף, כל מתאם כאן מוגבל למשימה הספציפית שלו ולרזולוציה מוגדרת היטב, למשל 1408 על 1600 עבור אפקט סופת חול. חריגה מהמבנה ומהניסוח של הפרומפטים המומלצים פוגעת ביכולת של המודל לסדר את הפאנלים בצורה נכונה.

שאלות
נפוצות

האם אפשר להשתמש במודל בלי להוריד את FLUX?

לא. מדובר בקובצי LoRA בלבד שמשקלם הכולל כ־1.6 גיגה בייט, והם דורשים את משקלי הבסיס של FLUX.1-dev כדי לפעול.

איך שולטים על התוכן של כל חלק בתמונה?

השליטה נעשית באמצעות חלוקה מילולית ברורה בתוך הפרומפט, עם תגיות ייעודיות לכל אזור כמו שמאל, ימין, או ארבעת הרבעים של הפריים.

איך מריצים

המשקל הכולל של הקבצים במאגר עומד על 1.6 גיגה בייט בפורמט safetensors, אך כדי להשתמש בהם בפועל חייבים להריץ ברקע את מודל הבסיס FLUX.1-dev. מודל הבסיס הזה דורש מעבד גרפי חזק מאוד עם לפחות 16 עד 24 גיגה בייט של זיכרון וידאו, במיוחד בהתחשב ברזולוציות הגבוהות שהמתאמים האלה דורשים, שמגיעות עד 2048 על 1024 פיקסלים.

ההרצה מתבצעת מקומית דרך ספריית diffusers בפייתון או בממשקי ComfyUI קיימים שפותחו עבור הפרויקט. אם אין לכם חומרת שרת ייעודית עם כרטיס תואם, תתקשו מאוד להפיק תמונות בקצב סביר, ובמצב כזה עדיף לשקול שירות ענן שמחזיק תשתית FLUX פעילה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("ali-vilab/In-Context-LoRA")
img = pipe("a photo").images[0]

הרישיון

המתאמים עצמם מפורסמים תחת רישיון MIT שמאפשר שימוש מסחרי חופשי ושינוי קוד. הבעיה היא שהם פועלים על גבי FLUX כמודל בסיס, ולכן אתם מחויבים לציית באופן מלא לתנאי הרישיון של FLUX, שאינם פתוחים באותה מידה ועשויים להגביל שימוש מסחרי ישיר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗