GPT
L

LongCat-Flash-Omni

קוד פתוח

meituan-longcatmit2025-10-23

  • transformers
  • safetensors
  • text-generation
  • any-to-any
  • custom_code

מודל ענק שמחבר טקסט, תמונה ושמע אינטראקטיבי בזמן אמת. הוא מפעיל רק 27 מיליארד פרמטרים מתוך 561 בזמן ריצה, ומציע חלופה פתוחה לחלוטין למודלי קול ווידאו סגורים.

  • 561Bפרמטרים
  • 131,072טוקנים בהקשר
  • 1.0 TBמשקל הקבצים
  • 146הורדות בחודש

מה זה

מדובר במודל MoE רב-מודאלי מלא של חברת Meituan, שנועד לקלוט ולהוציא אודיו, וידאו וטקסט. מתוך 560 מיליארד פרמטרים, הוא מפעיל בפועל רק 27 מיליארד בכל צעד חישוב, מה שמאפשר לו לייצר תגובות שמע בזמן אמת בלי להקריב את עומק ההבנה. התשתית שלו משלבת תמיכה בהקשר של 128 אלף טוקנים לצד מנגנון שמעביר שברי וידאו ואודיו במקביל.

במבחני ביצועים הוא עומד ראש בראש מול מודלים קנייניים. בבדיקות הבנת אודיו ווידאו כמו MVBench הוא הגיע לציון של 75.2 נקודות, ובמבחן ההיגיון הטקסטואלי MMLU השיג 90.3, תוצאות שמשתוות ל־Gemini 2.5 Flash ומקדימות מערכות פתוחות מתחרות. ההבדל המרכזי מול מתחרים אחרים בקטגוריה הוא היתוך עמוק ומוקדם של האודיו ישירות לתוך המודל, במקום שרשור של מנועי המרת דיבור נפרדים.

מתאים ל

  • סייען קולי מבוסס וידאו

    ניתוח רצף וידאו ושיחה קולית זורמת בו-זמנית בזכות עיבוד שמע ווידאו משולב וזמני תגובה מהירים.

  • תמלול ותרגום פגישות

    הקשבה להקלטות ארוכות וזיהוי דיבור ברמת שגיאות נמוכה תוך תרגום ישיר של תוכן השיחה.

  • אוטומציה של ממשקי משתמש

    זיהוי אלמנטים גרפיים ושליטה במסכים עם דיוק של מעל 91 אחוזים במבחני AndroidControl ו־ScreenSpot.

איפה זה נופל

למרות גודלו, המודל סובל מנפילות במשימות מעקב אחר הוראות מורכבות. במבחן IFEval הוא קיבל 82.44 בלבד, ירידה מורגשת לעומת גרסת הטקסט הרגילה של אותה סדרה שעמדה על 89.65. במבחני הבנת מסמכים והסקה מתמטית רב-שלבית כמו MMMU הוא השיג 70.7, פער משמעותי מול מודלים מובילים שמגיעים לאזור ה־80. בנוסף, הכרטיס מזהיר במפורש מפני הבדלי ביצועים בין שפות שונות, כך שבחינה מקדימה בעברית היא חובה לפני כל מחשבה על יישום מעשי.

שאלות
נפוצות

האם אפשר להריץ את המודל על תחנת עבודה עם כרטיס RTX 4090 בודד?

לא. משקל הקבצים לבדו הוא טרה-בייט אחד, והארכיטקטורה דורשת לפחות שמונה מאיצי שרתים עם 141GB זיכרון כל אחד בפורמט FP8. חומרה ביתית או תחנות עבודה רגילות לא מסוגלות אפילו לטעון את המשקלים לזיכרון.

האם המודל נתמך ישירות בגרסאות היציבות של vLLM או SGLang?

נכון לעכשיו לא. ההרצה דורשת התקנה מפיצול פיתוח ספציפי של SGLang שמסופק על ידי החברה, יחד עם התאמות מקומיות של מקביליות טנזורים ומומחים.

האם יש צורך במודל Whisper נפרד כדי לדבר איתו בקול?

אין צורך. המודל מעבד אודיו ישירות משלב הקלט ועד לשלב יצירת התשובה הקולית, ללא תלות במנגנוני המרת קול לטקסט חיצוניים.

איך מריצים

כדי להריץ אותו מקומית נדרשת חומרת שרתים כבדה מאוד. המשקל הכולל של הקבצים מגיע לטרה-בייט שלם. עבור הרצה בפורמט FP8 תצטרכו שרת עם לפחות 8 כרטיסי H20 של 141GB, וכדי לטעון את המשקלים המלאים ב־BF16 הדרישה קופצת לשני שרתים נפרדים עם 16 מאיצי H800 של 80GB.

ההפעלה מתבצעת כרגע דרך ענף פיתוח ייעודי של SGLang ולא בגרסה הראשית של הספרייה. אם אין לכם גישה לאשכול שרתים ייעודי ותקציב חשמל של חוות שרתים, אין היתכנות להרצה מקומית ועדיף לפנות ל־API או לנסות את ההדגמות בממשק הרשת שלהם.

from transformers import pipeline

pipe = pipeline("any-to-any", model="meituan-longcat/LongCat-Flash-Omni")
print(pipe("שלום"))

הקבצים

104 קבצים במאגר, 1.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים והקוד משוחררים תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית. הרישיון אינו מעניק זכויות שימוש בסימני המסחר או בפטנטים של חברת Meituan.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗