GPT
L

LongCat-Image-Dev

קוד פתוח

meituan-longcatapache-2.02025-12-04

  • transformers
  • diffusers
  • safetensors
  • text-to-image
  • en

גרסת פיתוח פתוחה למודל יצירת תמונות מטקסט, שנועדה לאימוני המשך והתאמות אישיות. היא מגיעה במצב גמיש שלא ננעל על ידי אימוני יישור מחמירים.

  • 27.3 GBמשקל הקבצים
  • 1,726הורדות בחודש
  • 49לייקים

מה זה

מדובר בנקודת ביקורת מוקדמת מתוך תהליך האימון של מודל יצירת התמונות מבית Meituan. במקום לשחרר רק תוצר סופי שעבר אופטימיזציה קשיחה עם חיזוקים והגבלות, הצוות בחר לשחרר בסיס בעל גמישות פרמטרית גבוהה. המצב הזה מונע את הנוקשות המובנית שנוצרת לרוב אחרי שלבי יישור מתקדמים, ומאפשר להזריק סגנונות חדשים בקלות רבה יותר.

המטרה כאן היא לתת נקודת מוצא נוחה להתאמות עמוקות. המפתחים מספקים שלד שמתאים לאימוני SFT ועדכוני LoRA, בלי צורך להילחם במשקולות שעברו התאמת יתר. במקום להנדס לאחור את תהליך הלמידה, מקבלים משקלים פתוחים שנועדו מראש לספוג דאטה נוסף ולעבור כוונון ייעודי בלי להישבר בקצוות.

מתאים ל

  • אימון LoRA מותאם

    בסיס גמיש שלא עבר יישור יתר, מושלם להזרקת סגנון אמנותי או דמויות ספציפיות.

  • מחקר והתאמת מודלים

    בדיקת שיטות יישור שונות כמו DPO ישירות על נקודת ביקורת פתוחה.

  • פיתוח כלי עריכה

    התאמת משקולות למשימות עיבוד תמונה מונחות טקסט בסביבת עבודה עצמאית.

איפה זה נופל

זו לא גרסה מלוטשת לשימוש קצה. בגלל שהמשקלים מגיעים מאמצע האימון ולפני שלבי יישור מלאים, קבלת תוצאה מדויקת מטקסט חופשי תדרוש מכם עבודה. התמיכה הרשמית מוגבלת לאנגלית ולסינית בלבד, כך שאין מה לבנות על הבנת עברית. בנוסף, כל נושא הבטיחות והסינון לא עבר כאן נעילה, מה שמחייב אתכם לבדוק טוב מה יוצא החוצה לפני שמחברים את זה למשתמשים.

שאלות
נפוצות

אפשר לייצר עם זה תמונות ישר אחרי ההורדה בלי לאמן?

אפשר להריץ אותו ליצירה בסיסית, אבל הוא לא נועד לזה. בלי כוונון או הנחיה מדויקת תקבלו תוצאות פחות מלוטשות ממודל סופי שעבר יישור מלא.

המודל מבין פרומפטים בעברית?

לא. המודל מוגדר רשמית רק לאנגלית ולסינית, ולכן פרומפטים בעברית כנראה יתעלמו מההנחיות או ייצרו זבל.

איך מריצים

המשקלים תופסים מעל 27 גיגה בייט, כך שמדובר במודל כבד שמחייב חומרת שרתים ייעודית. תצטרכו כרטיס מסך מקצועי עם זיכרון וידאו נדיב מאוד, במיוחד אם הכוונה היא לאמן שכבות נוספות ולא רק לייצר תמונה בודדת. המודל מתממשק ישירות עם ספריית transformers וקוד האימון פתוח בגיטהאב של הפרויקט.

אם אתם צריכים רק תמונות מהירות בלי לגעת במשקולות או לאמן LoRA משלכם, אין שום סיבה לספוג את עלויות הברזלים האלה. במצב כזה עדיף לחפש שירות מנוהל או גרסה מיושרת ומוכנה, במקום להרים שרת אימונים יקר.

from transformers import pipeline

pipe = pipeline("text-to-image", model="meituan-longcat/LongCat-Image-Dev")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן עליו גרסאות חדשות ולהפיץ אותן, כל עוד שומרים על תנאי הרישיון המקוריים ומצרפים את הקרדיט הנדרש למפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗