GPT
L

LongCat-Flash-Thinking-2601

קוד פתוח

meituan-longcatmit2026-01-14

  • LongCat-Flash-Thinking-2601
  • safetensors
  • transformers
  • text-generation
  • conversational

מודל חשיבה מבוסס תערובת מומחים עם חלון של כמעט מיליון טוקנים, שתוכנן במיוחד להפעלת כלים בסביבות רועשות.

  • 562Bפרמטרים
  • 983,040טוקנים בהקשר
  • 1.0 TBמשקל הקבצים
  • 3,135הורדות בחודש

מה זה

מדובר במודל MoE עם 560 מיליארד פרמטרים בסך הכול, אך רק 27 מיליארד מופעלים בכל טוקן. המטרה המרכזית שלו היא ביצוע משימות סוכן, חיפוש ברשת ושימוש בכלים מורכבים דרך תהליכי חשיבה מובנים. הוא כולל מצב חשיבה כבדה שמייצר נתיבי פתרון מקבילים ומתמצת אותם כדי לפתור בעיות קשות במיוחד.

במבחני ביצועים של הפעלת כלים, המודל מציג יתרון ברור כשהסביבה משובשת. במבחן tau2-Noise הוא הגיע לציון 67.1 ועקף מודלים מובילים אחרים, ובמבחן החיפוש BrowseComp הוא הגיע לתוצאה של 73.1. עם זאת, במבחני תכנות רגילים כמו SWE-bench הוא קיבל 70.0, תוצאה שנשארת מאחורי חלק מהמתחרים הבולטים בקטגוריה.

מתאים ל

  • סוכנים לאוטומציה תהליכית

    הוא מתוכנן במיוחד להתמודד עם שגיאות בממשקי API ושיבושים בסביבות עבודה מורכבות.

  • חיפוש ברשת ואיסוף מידע

    ציונים גבוהים במבחני חיפוש מבוססי סוכן וחלון הקשר עצום של 983,040 טוקנים.

  • פתרון בעיות מתמטיות קשות

    מצב החשיבה הכבדה השיג 100 במבחן AIME-25 באמצעות שילוב כלי חישוב והעמקת החשיבה.

איפה זה נופל

בכרטיס המודל מודגש שהוא לא נבדק לכל משימה אפשרית, ויש הבדלי ביצועים בין שפות שונות שצריך לבדוק לבד, נקודה קריטית אם אתם מתכננים לעבוד איתו בעברית. בנוסף, במבחני שאלות ותשובות כלליות ללא כלים כמו HLE הוא השיג רק 25.2, מה שמראה שבלי יכולת להריץ כלי או קוד ברקע, הידע הטהור שלו מוגבל יחסית.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת עם כרטיס בודד?

לא. המודל שוקל טרה-בייט אחד ומכיל 560 מיליארד פרמטרים. תצטרכו שרת מרובה כרטיסי זיכרון גבוהים כדי לטעון אותו, אפילו כשמדובר בארכיטקטורת מומחים.

איך עובד ניהול הזיכרון בשיחות ארוכות עם כלים?

תבנית השיחה זורקת כברירת מחדל את טקסט החשיבה של הסיבובים הקודמים ושומרת רק את התשובות והקריאות לכלים. אם אתם רוצים לשמור את היסטוריית החשיבה המלאה, צריך להפעיל פרמטר ייעודי בהגדרות הטוקנייזר.

איך מריצים

משקל הקבצים עומד על טרה-בייט שלם, מה שאומר שהרצה עצמית דורשת מערך שרתים כבד עם מספר כרטיסי GPU חזקים מאוד כדי להחזיק את כל המשקלים בזיכרון. המפתחים הוסיפו התאמות להרצה בספריות SGLang ו־vLLM, והתבנית שלו דורשת הגדרות ספציפיות כדי לאפשר חשיבה ושימוש בכלים.

אלא אם כן יש לכם קלאסטר ארגוני ייעודי שכבר פעיל ומשלם על החשמל, אין טעם להוריד טרה-בייט של משקלים בשביל בדיקות. עדיף להשתמש בגרסת האתר שהם העלו או לחכות לנקודת קצה מסודרת, במיוחד כשרוצים לבדוק תרחישים נקודתיים.

pip install -U huggingface_hub
hf download meituan-longcat/LongCat-Flash-Thinking-2601

הקבצים

87 קבצים במאגר, 1.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים שוחררו תחת רישיון MIT, שזה הרישיון הכי פתוח שיש. מותר להשתמש בהם לצרכים מסחריים, לשנות, להפיץ ולשלב במוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון לא כולל זכויות בסימני מסחר או פטנטים של החברה המפתחת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗