GPT
L

Ling-2.5-1T

קוד פתוח

inclusionAImit2026-02-14

  • transformers
  • safetensors
  • bailing_hybrid
  • text-generation
  • conversational

מודל ענק של טריליון פרמטרים שרץ עם 63 מיליארד פרמטרים פעילים ומיועד למענה מהיר עם קשר ארוך. הוא רלוונטי למי שחייב תפוקה מהירה בחלונות טקסט עצומים ורוצה רישיון חופשי.

  • 1012Bפרמטרים
  • 131,072טוקנים בהקשר
  • 1.8 TBמשקל הקבצים
  • 343הורדות בחודש

מה זה

מדובר במודל שפת מקור מסוג תערובת מומחים שמציע 1,012 מיליארד פרמטרים בסך הכל, אך מפעיל רק 63 מיליארד בכל טוקן כדי לשמור על מהירות הפקה. הוא אומן על 29 טריליון טוקנים ומשתמש בשילוב של תשומת לב לינארית ומנגנוני דחיסה כדי להחזיק הקשר של 256 אלף טוקנים באופן טבעי, עם יכולת הרחבה עד למיליון טוקנים.

הייחוד שלו על פני מודלים בסדר גודל דומה הוא תפוקת פענוח גבוהה במיוחד שאינה דועכת בטקסטים ארוכים. במבחני RULER ואיחזור מידע מתוך מיליון טוקנים הוא מציג יתרון מול ארכיטקטורות מקבילות בקוד פתוח, כשהמטרה שלו היא לתת ביצועי הסקת מסקנות קרובים למודלי חשיבה ארוכים בלי לבזבז כמות מרובעת של טוקנים בפלט.

מתאים ל

  • סריקת מסמכי ענק

    ניתוח ואיחזור מידע מדוחות פיננסיים או תיקים משפטיים של מאות אלפי טוקנים בחלון של עד מיליון.

  • הפעלת כלים וקריאות פונקציה

    שילוב במערכות תכנות ואוטומציה חיצוניות, הודות לאימון מותאם על מבחן BFCL-V4 לפקודות קוד.

  • שירותי שיחה מהירים בנפח גבוה

    תשתיות הדורשות זמן תגובה מיידי וייצור טקסט זריז בלי להמתין לשרשראות מחשבה איטיות ומנופחות.

איפה זה נופל

למרות הגודל המרשים, המפתחים מודים בגלוי שהמודל עדיין מפגר מאחורי מודלים קנייניים מובילים כמו GPT 5.2 או Gemini 3 Pro במשימות ארוכות טווח ובאינטראקציות סוכנים מורכבות. הוא מוגדר כבעל יכולות סוכן ראשוניות בלבד, כך שלא הייתי סומך עליו בעיניים עצומות בביצוע שרשראות פעולה מסובכות שדורשות אמינות מוחלטת בלי לבדוק לעומק את שיעור השגיאות.

שאלות
נפוצות

אפשר להריץ אותו על שרת בודד עם 8 כרטיסים?

המשקלים לבדם שוקלים 1.8 טרה-בייט בפורמט המקורי, ולכן שרת בודד אינו מספיק לזיכרון הנדרש. ההרצה דורשת חלוקה על פני מספר שרתים מרובי כרטיסים במקביל, לפחות עד שיופצו גרסאות מכווצות בקוונטיזציה נמוכה יותר.

האם הוא מבין עברית ברמה גבוהה?

כרטיס המודל לא מפרט תמיכה ייעודית בעברית, ועיקר האימון על 29 טריליון טוקנים מתמקד באנגלית ובסינית. הוא כנראה מסוגל לעבד עברית בסיסית, אך חובה לבחון את השפה בפועל לפני שבונים עליו מוצר מקומי.

איך מריצים

להריץ מפלצת ששוקלת 1.8 טרה-בייט בפורמט bfloat16 זו משימת תשתית כבדה. הדוגמה הרשמית מבוססת על SGLang ודורשת אשכול של ארבעה שרתים נפרדים, כשבכל אחד מהם שמונה מאיצים גרפיים, תוך שילוב מקביליות טנזורים וצינורות.

אם אין לכם חוות שרתים עם 32 כרטיסי H200 או H20 מתאימים, אין שום הגיון טכני לנסות לארח אותו עצמאית. עדיף להמתין לממשקי ה־API שהיוצרים הבטיחו לשחרר בקרוב במקום להקים סביבת הרצה שעולה הון תועפות.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ling-2.5-1T")
print(pipe("שלום"))

הקבצים

173 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא MIT, שזה הרישיון הפתוח והמתירני ביותר שקיים. אתם רשאים לקחת את המשקלים, לשנות, להטמיע במוצר מסחרי ולהפיץ אותו בחופשיות, בלי לשלם תמלוגים ובלי חובת פתיחת קוד, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗