GPT
L

LongCat-Image

קוד פתוח

meituan-longcatapache-2.02025-12-04

  • transformers
  • diffusers
  • safetensors
  • text-to-image
  • en

מודל פתוח של 6 מיליארד פרמטרים שמתמחה ברינדור טקסט בתוך תמונה באנגלית ובסינית. הוא רלוונטי למי שצריך תמונות ריאליסטיות ושילוב כיתוב מדויק בלי להחזיק מודלי ענק כבדים.

  • 27.3 GBמשקל הקבצים
  • 14,500הורדות בחודש
  • 248לייקים

מה זה

מדובר במודל טקסט לתמונה דו לשוני באנגלית ובסינית, שמכוון לפתור בעיה מוכרת של שילוב אותיות ומילים בתוך תמונה. הוא מגיע במשקל קבצים כולל של 27.3 גיגה בייט, עם דגש על פוטוריאליזם ויעילות בהרצה. לפי הדיווח, הוא עוקף במבחנים מודלים פתוחים כבדים ממנו בהרבה, בזכות ארכיטקטורה יעילה ואימון ייעודי.

הייחוד המרכזי שלו נמצא ברינדור טקסט, בעיקר בסינית שבה הוא מכסה מילון רחב מאוד, אבל גם באנגלית. המודל מתבסס על מנגנון קידוד ברמת התו שמופעל ברגע שמגדירים לו טקסט בתוך מרכאות, מה שמאפשר לו לצייר שלטים, תוויות או כותרות בדיוק גבוה במקום לייצר אותיות מרוחות ומעוותות.

מתאים ל

  • עיצוב שלטים ואריזות בסינית

    הוא נבנה במיוחד לרינדור תווים סיניים במדויק, תחום שבו רוב המודלים המערביים נכשלים לחלוטין.

  • תמונות מוצר עם כיתוב באנגלית

    מנגנון קידוד התווים במרכאות מאפשר לשלב טקסט קריא וברור על מוצרים וכרזות בלי עיוותים.

  • הפקה מקומית של תמונות ריאליסטיות

    בזכות גודל של 6B פרמטרים, הוא מספק תוצאות פוטוריאליסטיות ביעילות גבוהה ממודלים כבדים יותר.

איפה זה נופל

הנקודה הקריטית ביותר היא הטיפול בטקסט. אם לא עוטפים את הטקסט המבוקש במרכאות בודדות או כפולות בתוך הפרומפט, מנגנון קידוד התווים הייעודי פשוט לא מופעל, והיכולת לרנדר מילים קורסת לגמרי. בנוסף, המודל אומן ותומך רק באנגלית ובסינית. אין פה שום תמיכה בעברית, ולנסות לבקש ממנו אותיות בעברית יוביל כמעט בוודאות לג'יבריש.

שאלות
נפוצות

האם המודל יודע לרנדר טקסט בעברית בתוך התמונה?

לא. המודל מוגדר ומאומן רשמית רק לאנגלית ולסינית. ניסיון לבקש טקסט בעברית יפיק כיתוב שגוי, כיוון שמנגנון קידוד התווים לא מכיר את האלפבית העברי.

למה המילים בתמונה יוצאות מטושטשות ולא נכונות?

במודל הזה חובה לסמן את הטקסט המבוקש בתוך מרכאות בתוך הפרומפט. בלי מרכאות, המערכת לא מפעילה את מנגנון הקידוד הייעודי לטקסט ואיכות הכיתוב נפגעת משמעותית.

האם כדאי להחזיק שרת ייעודי בשביל המודל הזה?

המשקל של הקבצים מגיע ל־27.3 גיגה בייט, כך שנדרש כרטיס מסך עם זיכרון משמעותי כדי לטעון ולהריץ אותו. אם אתם לא מייצרים תמונות באופן רציף, עדיף להשתמש בספק ענן לפי דרישה במקום להחזיק חומרה כבדה.

איך מריצים

כדי להריץ אותו צריך להתקין את diffusers ישר ממאגר הגיטהאב של Hugging Face. עם משקל של מעל 27 גיגה בייט בפורמט המקורי, תצטרכו כרטיס מסך חזק עם מספיק זיכרון וידאו ייעודי, או לחפש גרסאות מכווצות שמישהו ימיר בהמשך.

היוצרים מציינים שאפשר לשפר את איכות התוצאות משמעותית אם מעבירים את הפרומפט דרך מודל שפה גדול חיצוני לפני השליחה למודל התמונה. אם אין לכם שרת עם GPU מתאים שפועל באופן קבוע, כנראה יהיה זול ופשוט יותר לפנות לשירותי ענן או API חיצוניים שמארחים אותו במקום לנהל את התשתית הזו בעצמכם.

from transformers import pipeline

pipe = pipeline("text-to-image", model="meituan-longcat/LongCat-Image")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗