GPT
L

Ling-2.6-flash

קוד פתוח

inclusionAImit2026-04-28

  • safetensors
  • bailing_hybrid
  • text-generation
  • conversational
  • custom_code

מודל מומחים מהיר שמפעיל 7.4 מיליארד פרמטרים מתוך 104 מיליארד בכל שלב. הוא חוסך טוקנים בפלט ונבנה במיוחד למשימות סוכנים וקריאות לכלים.

  • 107Bפרמטרים
  • 131,072טוקנים בהקשר
  • 200 GBמשקל הקבצים
  • 2,209הורדות בחודש

מה זה

במקום להאריך בהסברים ולנפח את עלויות הריצה, המודל אומן לספק תשובות קצרות וישירות. לפי כרטיס המודל, בבדיקות של Artificial Analysis הוא צרך 15 מיליון טוקנים בלבד תוך שמירה על ביצועים גבוהים. המבנה שלו משלב מנגנון מומחים דליל יחד עם שכבות ליניאריות, מה שמאפשר לו להגיע לקצב ייצור של עד 340 טוקנים לשנייה במערך שרתים מתאים.

החוזק העיקרי שלו מתבטא במדדים כמו SWE-bench Verified ו־BFCL-V4, שבוחנים יכולת להפעיל כלים, לתקן קוד ולנהל תהליכים מרובי שלבים. הוא תואם לעבודה מול סביבות כמו Claude Code ו־Hermes Agent, ומציע אלטרנטיבה זריזה במיוחד למשימות אוטומציה שחוזרות על עצמן.

מתאים ל

  • סוכני תכנות ותיקון קוד

    מתאים לשילוב בסביבות פיתוח אוטונומיות בזכות ציונים חזקים ב־SWE-bench וצריכת טוקנים נמוכה.

  • הפעלת כלים ו־APIs

    מספק יכולת טובה במבחני BFCL-V4 לביצוע קריאות לפונקציות ברצף תהליכים מרובה שלבים.

  • תהליכי אוטומציה עתירי קלט

    מנגנון הקשב הליניארי מאפשר עיבוד הקשר ארוך וייצור תגובות מהיר יחסית לחלופה סטנדרטית.

איפה זה נופל

ההתמקדות בתשובות קצרות מגיעה עם מחיר ברור. המפתחים מודים שבעומק הסקה מוגבל, המודל עלול לסבול מהזיות בהפעלת כלים. בנוסף, קיימות חולשות במעבר טבעי בין אנגלית לסינית ובציות להוראות מורכבות במיוחד. מבחינת שפה, הדף מציין תמיכה רשמית באנגלית בלבד, כך שאין להסתמך עליו בעיבוד טקסט עברי.

שאלות
נפוצות

האם כדאי לבחור בו עבור משימות הסקה מורכבות?

לא. המודל מכוון במפורש לחסוך טוקנים ולתת תשובות ישירות, מה שפוגע בעומק החשיבה. המפתחים בעצמם מציינים שבמשימות סבוכות הוא עלול לטעות בהפעלת כלים עקב חוסר בהסקה ארוכה.

האם נדרש קוד ייעודי כדי להריץ את המודל בשרת מקומי?

כן. בגלל ארכיטקטורת BailingMoeV2_5 המשולבת, יש להפעיל את הדגל trust-remote-code בספריות כמו vLLM או SGLang. עבור יכולות חיזוי מתקדמות, המפתחים אף ממליצים להשתמש בפיצול ייעודי שלהם לספריית SGLang.

איך מריצים

במשקל של 200 גיגה בייט בדיוק bfloat16, המודל דורש לפחות ארבעה כרטיסי מסך חזקים עם Tensor Parallelism כדי לרוץ. המפתחים מדגימים הרצה על ארבעה מאיצי H20 באמצעות SGLang או vLLM, עם דגש על שימוש בארגומנט trust-remote-code בשל הארכיטקטורה הייחודית שלו.

אם אין לכם שרת כזה זמין בענן, עלויות החומרה והתחזוקה יהיו גבוהות מדי לשימוש נקודתי. המפתחים מספקים גם גרסת FP8 ומציעים אפשרות לבצע Multi-Token Prediction באמצעות גרסה מותאמת של SGLang.

pip install -U huggingface_hub
hf download inclusionAI/Ling-2.6-flash

הקבצים

41 קבצים במאגר, 200 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות, בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗