GPT
B

Boogu-Image-0.1-Edit

קוד פתוח

Booguapache-2.02026-06-16

  • diffusers
  • safetensors
  • image-to-image
  • en
  • zh

מודל עריכת תמונות מבוסס הנחיות טקסט של עשרה מיליארד פרמטרים. הוא מיועד למי שמחפש שליטה מקומית בעריכת תמונה בודדת ורינדור טקסט באנגלית ובסינית בלי תלות בספקים סגורים.

  • 10Bפרמטרים
  • 35.9 GBמשקל הקבצים
  • 950הורדות בחודש
  • 186לייקים

מה זה

מדובר בגרסת העריכה ממשפחת מודלי Boogu, שמבצעת מניפולציות על תמונות קיימות באמצעות הוראות טקסטואליות. הוא יודע להוסיף אובייקטים, להסיר אלמנטים, לשנות רקע, להחליף סגנון אמנותי ולערוך טקסט מובנה בתוך הקובץ. המודל אומן עם דגש על צילום ריאליסטי ושילוב טיפוגרפיה, תוך שימוש במערך נתונים קטן בסדר גודל בהשוואה לחלופות פתוחות.

היוצרים הציגו מדד ELO עצמאי המבוסס על יותר מאלף פרומפטים מבוססי פרסונות, שבו המשפחה מציגה ביצועים תחרותיים מול מערכות מובילות. בפועל, המשמעות היא שהמודל מצטיין בהבנת קומפוזיציה ורינדור טקסט מורכב ביחס לגודלו, אך נשען על תהליך הסקה מלא של 25 עד 50 צעדים, בניגוד לגרסת הטורבו המזוקקת שרצה בארבעה צעדים בלבד.

מתאים ל

  • עריכת טיפוגרפיה בשלטים

    החלפה ותיקון של טקסטים באנגלית או סינית על גבי אריזות, שלטים וכרזות קיימות ללא פגיעה בעיצוב.

  • הסבת סגנון צילומי

    שינוי אווירה ותאורה בצילומים קיימים, כמו הפיכת תמונת יום ללילה או המרה לאיור עיפרון מבוסס פרומפט.

  • החלפת אובייקטים ורקעים

    החלפה והסרה של פריטים נקודתיים בתמונת מוצר תוך שימור יחסי התאורה והקומפוזיציה המקורית.

איפה זה נופל

המודל תומך בתמונת מקור אחת בלבד בכל פעולה, ואינו שומר היטב על עקביות הדמות והזהות בעריכות עוקבות מורכבות. השימוש ברכיב VAE של FLUX.1 יוצר איבודי מידע שמתבטאים בעיוותים של פנים קטנות, גפיים ועיניים מרוחקות, ובזוויות צילום חריגות מבנה הגוף נוטה להתפרק. בנוסף, חסר לו ידע עולם על מותגים, אתרים מפורסמים ואישים, ותמיכת השפות מוגבלת לאנגלית וסינית. עברית לא נתמכת ותייצר שיבושים.

שאלות
נפוצות

האם המודל מתאים לעריכת טקסט בעברית בתוך תמונות?

לא. התמיכה הלשונית והטיפוגרפית מוגבלת לאנגלית ולסינית בלבד. ניסיון לערוך או להפיק אותיות בעברית יוביל לפלט משובש, טעויות כתיב ועיוותים חזותיים בעיצוב.

כמה תמונות מקור אפשר להזין לפעולת עריכה אחת?

הגרסה הנוכחית מקבלת תמונת מקור בודדת בלבד. הצוות הצהיר על כוונה להרחיב את התמיכה לריבוי תמונות ייחוס בעתיד, אך כרגע אי אפשר למזג בין כמה תמונות קלט.

מה ההבדל בין גרסה זו לגרסת Edit Turbo?

גרסת הבסיס הזו דורשת 25 עד 50 צעדי הסקה ומאפשרת ייצור יציב ברזולוציות של עד 2K. גרסת הטורבו עברה זיקוק לארבעה צעדים לצורך מהירות, אך יציבה בעיקר ברזולוציית 1K.

איך מריצים

המשקל הכולל של הקבצים עומד על כמעט 36 ג'יגה בייט. להרצה מלאה ללא דחיסה ברוזולוציית 1K נדרש כרטיס עם 40 עד 80 ג'יגה זיכרון גרפי, כמו A100. אם יש לכם 16 או 24 ג'יגה זיכרון, תצטרכו להפעיל פריקה למעבד או להשתמש בגרסת FP8 כדי לא לקבל שגיאות זיכרון. ההרצה המקומית נתמכת דרך ספריית diffusers, שרת vLLM Omni, תוסף ייעודי ל־ComfyUI וגרסה ייעודית למאיצי NPU של Ascend.

הצוות מדגיש שאין לו שירות מסחרי או ממשק תכנות בתשלום, וכל הצעה כזו ברשת אינה רשמית. לכן, מי שאינו מחזיק בחומרה מתאימה להרצה עצמית לא יכול לצרוך את המודל הזה דרך שירות מנוהל של המפתחים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Boogu/Boogu-Image-0.1-Edit")
img = pipe("a photo").images[0]

הקבצים

55 קבצים במאגר, 35.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי קוד והפצה מחדש, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. עם זאת, היוצרים מצהירים שמדובר בפרויקט מחקרי בלבד שאינו מוכן לפריסה בייצור ללא מנגנוני סינון ובדיקות התאמה עצמאיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗