GPT
L

LongCat-Flash-Thinking

קוד פתוח

meituan-longcatmit2025-09-21

  • LongCat-Flash-Chat
  • safetensors
  • text-generation
  • transformers
  • conversational

מודל הסקת מסקנות בקוד פתוח עם 560 מיליארד פרמטרים שמתמחה בהוכחת משפטים מתמטיים ובקריאות לכלים, ברישיון MIT מלא.

  • 562Bפרמטרים
  • 131,072טוקנים בהקשר
  • 1.0 TBמשקל הקבצים
  • 166הורדות בחודש

מה זה

מדובר במודל MoE ענק שכולל 562 מיליארד פרמטרים, אבל מפעיל בכל ריצה בין 18.6 ל־31.3 מיליארד פרמטרים בלבד, עם ממוצע של כ־27 מיליארד. הוא עבר אימון חיזוק מבוזר ומקבילי שנועד לייצב פתרון בעיות מורכבות במתמטיקה, בקוד ובהפעלת כלים חיצוניים.

התוצאות במבחנים מראות יתרון מובהק בהוכחת משפטים פורמלית בסביבת Lean 4, שם הוא עוקף מודלים סגורים כמו OpenAI-o3 ו־GPT-5-Thinking בפער ניכר במבחן MiniF2F. בתחומים כמו ידע כללי ומענה שאלות סטנדרטי הוא מציג ציונים נמוכים במעט ממתחריו, אבל שומר על דיוק גבוה בבטיחות ובמתמטיקה תחרותית.

מתאים ל

  • הוכחת משפטים ב־Lean 4

    המודל הציג 67.6% ב־MiniF2F, ציון גבוה משמעותית מכל מתחרה שנבדק.

  • סוכני קוד עם כלים חיצוניים

    תומך בפורמט ייעודי לקריאת כלים ובפרוטוקול MCP לביצוע משימות רב־שלביות.

  • פתרון בעיות מתמטיקה

    מגיע ל־99.2% ב־MATH500 ומשלב חשיבה מפורטת צעד אחר צעד.

איפה זה נופל

המודל מציג ביצועים פושרים יחסית במשימות הנדסת תוכנה מורכבות, עם ציון של 59.4% ב־SWE-Bench, נמוך משמעותית ממודלים מובילים אחרים. בנוסף, המפתחים מציינים במפורש שהביצועים משתנים בשפות שונות, ומאחר שמדובר בפיתוח סיני, אין בדיקות מתועדות ליכולות בעברית וסביר שהוא יתקשה בה.

אותה משפחה

LongCat-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת יחיד עם כרטיס H100 בודד?

לא. המודל שוקל טרה־בייט שלם בקבצים הדורשים זיכרון גרפי עצום רק כדי להיטען. תצטרכו מערך מרובה שרתים או פתרונות קוונטיזציה קיצוניים שלא נתמכים באופן רשמי.

איך מפעילים את מנגנון החשיבה המעמיקה במודל?

המפתחים הגדירו תבנית פרומפט ספציפית שכוללת את הפקודה think_on לפני תשובת המודל, ובאתר ההדגמה יש להפעיל כפתור ייעודי כדי לקבל את תהליך ההסקה המלא.

איך מריצים

המשקלים שוקלים טרה־בייט שלם ומחולקים ל־86 קבצים. כדי להרים אותו מקומית דרוש קלאסטר של כמה שרתי GPU עם מאות גיגה־בייט של VRAM, כאשר המפתחים מספקים התאמות לתשתיות SGLang ו־vLLM.

אם אין לכם חוות שרתים ייעודית של עשרות אלפי דולרים, עדיף בהרבה להשתמש באתר ההדגמה או ב־API חיצוני כשיעלה, שכן הרצה עצמית של מודל במשקל טרה־בייט אינה מעשית לחברות קטנות או למפתחים בודדים.

pip install -U huggingface_hub
hf download meituan-longcat/LongCat-Flash-Thinking

הקבצים

86 קבצים במאגר, 1.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות, להפיץ ולשלב במוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗