GPT
L

LongCat-Flash-Lite

קוד פתוח

meituan-longcatmit2026-01-27

  • LongCat-Flash-Lite
  • safetensors
  • text-generation
  • transformers
  • conversational

מודל קוד וסוכנים שמפעיל פחות מחמישה מיליארד פרמטרים בפועל בכל צעד. הוא מציע חלון הקשר ענקי בלי צווארי הבקבוק הרגילים של מודלים מרובי מומחים.

  • 69Bפרמטרים
  • 327,680טוקנים בהקשר
  • 129 GBמשקל הקבצים
  • 10,857הורדות בחודש

מה זה

במקום לדחוף עוד מומחים כמו רוב מודלי ה־MoE, המודל הזה מקצה יותר משלושים מיליארד פרמטרים לטבלת שיבוצי N-gram. המבנה הזה פותר את צווארי הבקבוק של קריאה מהזיכרון ומאיץ את תהליך ההסקה, תוך שהוא מפעיל רק בין 2.9 ל־4.5 מיליארד פרמטרים בפועל בכל טוקן.

התוצאות במבחני הביצועים מראות פער בולט לטובתו במשימות סוכנים וכתיבת קוד. במבחן SWE-Bench הוא מגיע ל־54.4 אחוזי הצלחה, ובמבחני שימוש בכלים כמו Tau2-Telecom הוא מציג דיוק של מעל שבעים אחוז, הרבה מעבר למודלים מתחרים בגודל דומה. הוא אינו מודל חשיבה עם שרשרת פנימית ארוכה, אלא מודל ישיר שמתמחה בהפעלת כלים ופתרון בעיות מעשיות.

מתאים ל

  • סוכני תכנות אוטונומיים

    הוא משיג 54.4 אחוז במבחן SWE-Bench, מה שהופך אותו לבחירה חזקה לפתרון באגים אוטומטי במאגרי קוד.

  • אוטומציה והפעלת כלים

    ציונים גבוהים במבחני Tau2 הופכים אותו למתאים למערכות שצריכות לתשאל ממשקי API ולהחזיר תשובות מובנות.

  • עיבוד פקודות בטרמינל

    תוצאה של 33.75 אחוז ב־TerminalBench מאפשרת להפקיד בידיו ביצוע פעולות ישירות בשורת הפקודה.

איפה זה נופל

למרות החוזק בכתיבת קוד, המודל מציג ביצועים פחות מרשימים בידע כללי. במבחן GPQA-Diamond הוא קיבל 66.78, תוצאה נמוכה משמעותית מזו של מודלים מתחרים. בנוסף, הארכיטקטורה דורשת הרצת קוד מרוחק חיצוני וקרנלים ייעודיים שלא נתמכים בכל סביבת עבודה סטנדרטית. אם האפליקציה שלכם נשענת על עברית, צריך לבדוק אותו בזהירות, שכן הכרטיס מזהיר במפורש מהבדלי איכות בין שפות שונות ולא מציג מדדים בעברית.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד או כרטיס מסך בודד?

לא. המודל שוקל 129 גיגה בייט ומחייב לפחות 160 גיגה בייט של זיכרון גרפי רק כדי להיטען, מה שדורש שני כרטיסי 80 גיגה בייט לפחות.

איך המודל מפעיל רק כשלושה מיליארד פרמטרים מתוך כמעט שבעים?

בזכות ארכיטקטורת תערובת מומחים וטבלת שיבוצים ייעודית, המודל טוען את כל המשקלים לזיכרון אך מחשב בפועל רק חלק זעיר מהם עבור כל מילה.

איך מריצים

כדי להריץ אותו עם ספריות Hugging Face תצטרכו לפחות שני כרטיסי מסך של 80 גיגה בייט, כמו A100 או H100. המשקלים שוקלים 129 גיגה בייט בפורמט bfloat16, כך שאין שום דרך לדחוס אותו לתחנת עבודה ביתית או לשרת עם כרטיס בודד.

לסביבת ייצור, הפרויקט כולל התאמה ייעודית למנוע SGLang שדורשת הידור של קרנלים מותאמים. הם מציגים פריסה על שרת של שמונה מאיצי H20 באמצעות שילוב של מקביליות מומחים ומקביליות טנזורים. אם אין לכם אשכול שרתים ייעודי ותקציב חומרה כבד, עדיף להמתין לשירותי ענן שיציעו גישה אליו דרך ממשק חיצוני.

pip install -U huggingface_hub
hf download meituan-longcat/LongCat-Flash-Lite

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו בתוך מוצרים סגורים ולהפיץ אותו בחופשיות, כל עוד משאירים את הצהרת זכויות היוצרים המקורית. הרישיון אינו מעניק זכויות שימוש בסימנים המסחריים או בפטנטים של חברת Meituan.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗