GPT
G

GLM-IMAGE-PRO

רץ בדפדפן

fantosopenrail++2024-09-02

  • gradio

מייצרים תמונות מטקסט או מתמונות קיימות עם דגש על שילוב כיתוב ברור בתוך התמונה. מתאים למי שצריך כרזות, לוגואים ושלטים ולא רוצה אותיות מרוחות ומעוותות.

  • הורדות בחודש
  • 215לייקים

מה זה

כותבים תיאור טקסטואלי בתיבה הייעודית, ואם רוצים אפשר להעלות גם תמונות קלט לגלריה לצורך עריכה או העברת סגנון. הממשק פולט תמונה מרונדרת לפי המידות וההגדרות שנבחרו. ברירת המחדל מוגדרת לרזולוציה של 1024 על 1024 פיקסלים, עם 50 צעדי דגימה וערך הנחיה של 1.5, לצד שליטה ידנית בסיד.

מאחורי הקלעים רץ המודל zai-org/GLM-Image דרך ספריית diffusers. מדובר במבנה משולב שמחבר מודל אוטורגרסיבי ודיפוזיה, עם 9 מיליארד פרמטרים לייצור ועוד 7 מיליארד פרמטרים לפענוח ברזולוציה גבוהה. המודל עבר כוונון בעזרת אלגוריתם GRPO כדי לשפר את הפרטים הקטנים ולדייק את הציור של אותיות שלמות בתוך התמונה.

מתאים ל

  • יצירת כרזות ושלטים

    כותבים פרומפט עם משפט מדויק ומקבלים גרפיקה שמציגה טקסט קריא וברור.

  • עריכת תמונות קיימות

    מעלים תמונה לגלריה ומשנים את הסגנון או האובייקטים לפי הנחיות טקסט.

  • עיצוב לוגואים

    מייצרים סמלילים שמשלבים איור עם שם מותג בלי עיוותים באותיות.

איפה זה נופל

הבעיה המיידית היא שהאפליקציה במצב מושהה ולא מקבלת בקשות כרגע. מעבר לזה, המודל מתמקד ביצירת טקסט מדויק, אבל ההצלחה באותיות תלויה בשפה, וסביר מאוד שהיא נבדקה בעיקר באנגלית ולא בעברית. ריצה של 50 צעדים על תמונות בגודל מלא תהיה אטית יחסית על חומרה חלשה יותר.

שאלות
נפוצות

למה הכפתור לא עובד כרגע?

האפליקציה נמצאת במצב מושהה בעמוד שלה. כדי להשתמש בה צריך להמתין שבעל הפרויקט יפעיל אותה שוב, או לשכפל את הקוד לחשבון שלכם ולהריץ אותה על חומרה משלכם.

האם זה עולה כסף?

השימוש בממשק עצמו הוא ללא תשלום כשהוא פעיל. אם תחליטו לשכפל את הקוד ולהריץ אותו בסביבה פרטית, תצטרכו לשלם על משאבי החומרה הנדרשים, כמו מאיץ ה־A10G.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד מבוסס על ספריות פתוחות כמו diffusers ו־Gradio וטוען מודל ציבורי. תצטרכו כרטיס מסך חזק מאוד עם מספיק זיכרון כדי להחזיק מודל של 9 מיליארד פרמטרים ומפענח של 7 מיליארד.

האם המודל תומך בעברית בתוך התמונות?

התיעוד מדבר על רינדור טקסט מדויק באופן כללי, ללא אזכור ספציפי של שפות שנבדקו. מודלים מהסוג הזה מאומנים לרוב על מאגרים באנגלית, כך שכתיבת טקסט עברי בתוך התמונה צפויה להיכשל או להניב אותיות משובשות.

איך משתמשים

מזינים פרומפט, משנים הגדרות מתקדמות אם רוצים, ולוחצים על הכפתור שמייצר את התמונה. הקוד משתמש ב־spaces ובמאיץ מסוג zero-a10g, מה שאומר שהרצת 50 צעדים לוקחת זמן עיבוד סביר על כרטיס גרפי ייעודי. כרגע לא תצליחו להריץ אותה בדפדפן כי הסטטוס שלה מוגדר כמושהה, כך שקודם צריך שהיוצר יפעיל אותה מחדש או שתשכפלו את הקוד לסביבה שלכם.

הרישיון

המטא-דאטה מגדיר רישיון openrail++, בעוד שבתיעוד כתוב רישיון MIT שמתיר שימוש מסחרי מלא. הסתירה הזו דורשת זהירות לפני שמשלבים את התוצרים בפרויקטים מסחריים, ומומלץ לבדוק את תנאי המודל המקורי. המידע שתעלו ותייצרו חשוף להגדרות הפרטיות של השרת המארח.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא ב־Hugging Face ↗