GPT
L

Ling-2.6-1T

קוד פתוח

inclusionAImit2026-04-29

  • transformers
  • safetensors
  • bailing_hybrid
  • text-generation
  • conversational

מודל ענק שמכוון למשימות קוד וסוכנים אוטונומיים. הוא משלב ארכיטקטורה היברידית כדי לקצר זמני תגובה ולחסוך טוקנים בחשיבה מורכבת.

  • 1026Bפרמטרים
  • 262,144טוקנים בהקשר
  • 970 GBמשקל הקבצים
  • 757הורדות בחודש

מה זה

מדובר במודל MoE עצום שמכיל מעל טריליון פרמטרים ומבוסס על שילוב של מנגנוני MLA ו־Linear Attention. המטרה של המבנה הזה היא לחתוך את צריכת הזיכרון וזמני ההמתנה כשרצים על הקשרים ארוכים, במיוחד מול חלון עבודה שמגיע עד 262,144 טוקנים. במקום לייצר שרשראות מחשבה אינסופיות שמנפחות את העלויות ואת זמן הריצה, המפתחים אימנו אותו לקצר תהליכים ולהגיע ישר לתשובה.

במדדים כמו SWE-bench Verified ו־BFCL-V4 הוא מציג יכולות ביצוע טובות מאוד במעקב אחרי הוראות מורכבות, כתיבת קוד ותיקון באגים, והפעלת כלים חיצוניים. המדידות מראות שהוא מתחרה ישירות במודלים המובילים בתחום הסוכנים ומצליח לפתור בעיות תכנות רב-שלביות בלי לאבד את ההקשר בדרך.

מתאים ל

  • סוכני פיתוח תוכנה

    חיבור ישיר לכלים כמו Claude Code ו־OpenCode לפתרון באגים וכתיבת קוד שלם בסביבות פיתוח מורכבות.

  • קריאות לפונקציות וכלים

    טיפול ברצף פעולות הדורש הפעלת כלי API מרובים בצורה יציבה ובלי להסתבך בהוראות ארוכות.

  • ניתוח מסמכי ענק

    קריאה ועיבוד של קבצים טכניים ארוכים בזכות חלון של 262K טוקנים וארכיטקטורת תשומת לב מואצת.

איפה זה נופל

הכרטיס מודה בפירוש בכמה נקודות תורפה: עקביות ארוכת טווח עדיין דורשת שיפור בתכנון משימות מורכבות ושליפת מידע, ויש בעיה של היסטים במעבר בין שפות תחת הוראות מסובכות. מעבר לזה, המודל דורש הפעלת trust-remote-code, מה שיוצר סיכון אבטחה אם מריצים אותו בארגון בלי לבדוק את הקוד שלו קודם.

שאלות
נפוצות

אפשר להריץ אותו על שרת מקומי במשרד?

רק אם יש לכם שרת מפלצתי עם שמונה כרטיסי GPU חזקים מאוד. הקבצים שוקלים 970 ג'יגה-בייט והוא דורש חלוקת זיכרון רחבה, כך שמחשב רגיל או שרת פשוט אפילו לא יצליחו לטעון אותו לזיכרון.

למה שהמודל הזה יהיה עדיף על מודלים גדולים אחרים?

הוא נבנה כדי לקצר את פלט המחשבה שלו ולענות מהר, מה שחוסך זמן וטוקנים. הוא גם משלב Linear Attention שמאיץ את העבודה עם מסמכים ארוכים בהשוואה למודלים סטנדרטיים.

הוא מתאים לעבודה בעברית?

הכרטיס מציין במפורש שיש לו בעיות מעבר בין שפות בהוראות מורכבות. עדיף לתת לו פקודות באנגלית ולבדוק היטב את הפלט אם מנסים לתשאל אותו בעברית.

איך מריצים

המשקל של הקבצים מגיע לכמעט טרה-בייט בדיוק bfloat16, כך שלהריץ אותו בעצמכם דורש שרת ייעודי כבד מאוד. כדי להרים אותו צריך לפחות שמונה מאיצים גרפיים חזקים במקביל, כפי שמודגם בהגדרות של SGLang ו־vLLM. בנוסף, כדי לנצל חיזוי של כמה טוקנים במקביל, צריך להתקין גרסה מיוחדת של SGLang שהמפתחים תיקנו בעצמם.

לרוב המוחלט של המפתחים אין שום סיבה כלכלית או טכנית לנהל שרת כזה. המודל זמין בחינם דרך OpenRouter וזמין גם ב־ZenMux, כך שחיבור דרך ה־API חוסך עשרות אלפי דולרים על חומרה והתעסקות עם קבצים בגודל מפלצתי.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ling-2.6-1T")
print(pipe("שלום"))

הקבצים

172 קבצים במאגר, 970 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון MIT. המשמעות פשוטה לגמרי: מותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים מסחריים, שינויים והפצה מחדש, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗