GPT
L

LongCat-Flash-Chat

קוד פתוח

meituan-longcatmit2025-08-29

  • LongCat-Flash-Chat
  • safetensors
  • text-generation
  • transformers
  • conversational

מודל שיחה פתוח עם 562 מיליארד פרמטרים שרץ בתצורת תערובת מומחים. הוא מפעיל רק 27 מיליארד פרמטרים בממוצע לכל טוקן, ומתמקד בביצוע פעולות סוכן וקריאות לכלים.

  • 562Bפרמטרים
  • 131,072טוקנים בהקשר
  • 1.0 TBמשקל הקבצים
  • 25,166הורדות בחודש

מה זה

מדובר במודל שפה גדול מאוד שמשתמש בארכיטקטורת MoE עם מנגנון חישוב דינמי. בפועל הוא בוחר כמה מומחים להפעיל בהתאם לחשיבות של כל טוקן, בטווח שנע בין 18.6 ל־31.3 מיליארד פרמטרים. זה שומר על עלות חישוב של מודל קטן בהרבה, בזמן שנפח הידע הכולל עומד על 560 מיליארד פרמטרים. חלון ההקשר שלו מגיע ל־128 אלף טוקנים, מה שמתאים לעיבוד שיחות ארוכות ומסמכים מורכבים.

במבחני ביצועים המפתחים מראים יתרון ברור במשימות סוכן ושימוש בכלים. במבחן tau-bench בתחום התקשורת הוא הגיע לתוצאה של 73.68, גבוה משמעותית ממודלים סגורים כמו Gemini 2.5 Flash ו־Claude 4 Sonnet שנבדקו ללא מנגנון חשיבה. עם זאת, במבחני תכנות כמו Humaneval+ עם 88.41 ו־SWE-Bench עם 60.4, הוא נשאר מאחור ביחס למודלים מובילים אחרים בגדלים האלה.

מתאים ל

  • סוכנים אוטונומיים

    אינטגרציה של קריאות לפונקציות וכלים מרובים בזכות תוצאות גבוהות במבחני tau-bench.

  • מערכות שירות מרובות שלבים

    ניהול שיחות שירות ארוכות ומורכבות עם תמיכה בהקשר של עד 128 אלף טוקנים.

  • אוטומציה של פקודות מסוף

    ביצוע תהליכי שורת פקודה וסקריפטים, שבהם המודל קיבל 39.51 במבחן TerminalBench.

איפה זה נופל

החולשה העיקרית שלו מופיעה בניווט גרפי ארוך בהקשר רחב. במבחן GraphWalks-128k הוא קיבל ציון של 51.05 בדיוק, נפילה חדה לעומת מתחרים שעוברים את ה־80. נקודה קריטית נוספת לקורא בארץ היא שאין שום מידע בכרטיס לגבי ביצועים בעברית. כל הנתונים מציגים מבחנים באנגלית ובסינית בלבד, והיוצרים מציינים מפורשות שקיימים פערי ביצועים בין שפות שונות ושחובה לבדוק את זה ידנית לפני שילוב במוצר.

אותה משפחה

LongCat-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על תחנת עבודה רגילה עם כרטיס בודד?

לא. משקלי המודל שוקלים טרה־בייט אחד ומכילים 562 מיליארד פרמטרים. תצטרכו שרת עם מספר כרטיסי מסך תעשייתיים עם מאות גיגה־בייט של זיכרון VRAM כדי לטעון אותו.

איך המודל מחזיר קריאות לפונקציות בקוד?

הוא עוטף את הפלט בתוך תגיות ייעודיות של XML בשם longcat_tool_call. בתוך התגית הוא מחזיר אובייקט JSON רגיל שמכיל את שם הפונקציה ואת הפרמטרים שנשלחים אליה.

האם המודל מתאים לפתרון בעיות קוד מורכבות?

הוא מתאים למשימות בסיסיות, אך במבחני SWE-Bench Verified הוא הגיע לתוצאה של 60.4 בלבד. מודלים אחרים בקטגוריית הגודל הזו מציגים תוצאות עדיפות בכתיבת תוכנה.

איך מריצים

המשקל הכולל של הקבצים מגיע לטרה־בייט שלם, כך שהרצה מקומית דורשת תשתית רצינית מאוד. תצטרכו שרת עם מספר מאיצים גרפיים בעלי נפח זיכרון עצום רק כדי לטעון את המשקלים, עוד לפני שמחשבים את הזיכרון עבור חלון הקשר של 128 אלף טוקנים. המודל נתמך בספריות ההרצה vLLM ו־SGLang, שמאפשרות ניהול מקבילי ויעיל של מומחים.

אם אין לכם אשכול שרתים ייעודי בארגון, אין הגיון כלכלי או טכני להוריד את הקבצים. במקרים כאלה עדיף לגשת לאתר הרשמי שלהם בכתובת longcat.ai או לחכות לגישה דרך ספקי API חיצוניים במקום לשלם על שרתים יקרים בענן רק בשביל הבדיקות.

pip install -U huggingface_hub
hf download meituan-longcat/LongCat-Flash-Chat

הקבצים

86 קבצים במאגר, 1.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט והמשקלים שוחררו תחת רישיון MIT. המשמעות היא חופש פעולה מלא, מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פרטיים בלי תמלוגים. ההגבלה היחידה היא שהרישיון לא מעניק זכויות שימוש בסימני המסחר או בפטנטים של חברת Meituan.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗