GPT
L

LongCat-Next

קוד פתוח

meituan-longcatmit2026-03-25

  • LongCat-Next
  • safetensors
  • longcat_next
  • text-generation
  • transformers

המודל הזה מטפל בטקסט, תמונה ואודיו כמערכת אחת של טוקנים בדידים. הוא מיועד למי שרוצה להריץ קלט ופלט מולטימודלי מלא בלי לחבר כמה מודלים נפרדים.

  • 74Bפרמטרים
  • 131,072טוקנים בהקשר
  • 150 GBמשקל הקבצים
  • 207הורדות בחודש

מה זה

הארכיטקטורה כאן שונה מרוב המודלים המולטימודליים המקובלים. במקום להשתמש באנקודר תמונה חיצוני שמזין וקטורים רציפים למודל שפה, הוא הופך ראייה ושמע למילים בדידות דרך טוקנייזרים ייעודיים, ואז מנבא את הטוקן הבא באותה צורה בדיוק. לפי כרטיס המודל, הבסיס הוא ארכיטקטורת תערובת מומחים של שלושה מיליארד פרמטרים פעילים, מתוך סך כולל של כ־74 מיליארד פרמטרים.

הגישה הזו מאפשרת לו לא רק להבין תמונות וקול, אלא גם לייצר תמונות, לבצע שיחה קולית מקצה לקצה, ולשכפל קול מתוך דגימת שמע. בכרטיס מציינים שמנגנון התמונות שומר על איכות טובה גם בדחיסה של פי 28, כולל ברינדור טקסט בתוך תמונה. הרעיון הוא איחוד אמיתי של המשימות, במקום שרשור של מודל שפה, מודל דיפוזיה ומנוע דיבור נפרד.

מתאים ל

  • שיחה קולית ישירה

    קבלת שמע והחזרת שמע באופן ישיר מקצה לקצה, בלי צורך במנוע תמלול ומנוע הקראה חיצוניים.

  • שכפול קול ויצירת דיבור

    סינתזה של טקסט לדיבור תוך חיקוי גוון הקול מתוך קובץ שמע קצר שמצורף לבקשה.

  • יצירה וניתוח של תמונות

    הבנת תמונות וייצור תמונות חדשות עם טקסט ברור בתוך אותו רצף שיחה ובמודל יחיד.

איפה זה נופל

הכרטיס מצהיר בפירוש שהמודל לא נבדק באופן מקיף לכל תרחיש שימוש, ומזהיר מפני פערי ביצועים משמעותיים בין שפות שונות. אם אתם בונים על עברית, יש כאן סיכון ממשי, רוב הדוגמאות מראות התמקדות מוחלטת באנגלית ובסינית, במיוחד במודול השמע. בנוסף, חבילת התלויות שלו רגישה במיוחד, כולל תלות בגרסאות ישנות של ספריות מערכת, והגדרות הדגימה ליצירת שמע ותמונה דורשות שרשור פרמטרים מורכב ועמוס.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי בודד?

לא. משקל הקבצים הוא 150 גיגה בפורמט bfloat16, והדרישה הרשמית היא לפחות שלושה כרטיסי 80 גיגה כדי לטעון אותו לזיכרון. ללא חומרת שרתים מתאימה אי אפשר לבצע איתו היסק.

האם הוא יודע לדבר ולייצר שמע בעברית?

הכרטיס מדגים שמע רק באנגלית ובסינית ומזהיר במפורש מהבדלי ביצועים בין שפות. הסיכוי שהוא יפיק דיבור בעברית טבעית נמוך מאוד, ויש לבדוק את זה ידנית לפני שמסתמכים עליו.

איך מריצים

בשביל להריץ אותו מקומית צריך לפחות שלושה מעבדים גרפיים של 80 גיגה זיכרון, כמו A100 או H100. המשקלים לבדם שוקלים 150 גיגה, והקוד דורש עבודה עם הגדרות טעינה מושהית לדקודרים, פייתון 3.10 וגרסאות ספציפיות מאוד של ספריות שמע. הצוות פיתח התאמה ל־SGLang עבור פריסה בייצור.

אם אין לכם שרת ייעודי בענן עם שלושה כרטיסים כאלה, אין מה לנסות להריץ אותו במשרד או במחשב פיתוח. במקרה כזה, עדיף להמתין לשירותי API מסחריים או להשתמש בפתרונות ענן מוכנים.

pip install -U huggingface_hub
hf download meituan-longcat/LongCat-Next

הרישיון

הרישיון הוא MIT מלא, הן על הקוד והן על משקלי המודל. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ מוצרים שמבוססים עליו, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון אינו מעניק זכויות בסימני המסחר או בפטנטים של Meituan.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗