GPT
L

Ling-1T

קוד פתוח

inclusionAImit2025-10-02

  • transformers
  • safetensors
  • bailing_moe
  • text-generation
  • conversational

מודל ענק של טריליון פרמטרים שרץ בתצורת תערובת מומחים עם חמישים מיליארד פרמטרים פעילים. הוא פונה למי שמחפש היסק חזק ומהיר במיוחד בלי שלב מחשבה גלוי וממושך.

  • 1000Bפרמטרים
  • 32,768טוקנים בהקשר
  • 1.8 TBמשקל הקבצים
  • 2,813הורדות בחודש

מה זה

זהו מודל בסיס רחב היקף המבוסס על ארכיטקטורת BailingMoeV2 ומאומן על יותר מעשרים טריליון טוקנים. הרעיון המרכזי כאן הוא שילוב של יכולות היסק עמוקות במתמטיקה, תכנות ולוגיקה, מבלי לייצר שרשראות חשיבה ארוכות שמנפחות את זמני המענה ואת עלויות הריצה.

המפתחים שמו דגש כבד על יצירת קוד פרונטאנד והבנה אסתטית, כולל מנגנון תגמול שמיועד לייצר ממשקים גרפיים תקינים ויפים. לפי כרטיס המודל, הוא מציג דיוק של כשבעים אחוזים בהפעלת כלים במבחן BFCL V3, הישג מרשים למודל שלא אומן ייעודית על מסלולי סוכנים נרחבים. במבחן AIME 25 הוא מתחרה במודלים סגורים מובילים ומציג יעילות גבוהה ביחס לאורך הפלט.

מתאים ל

  • פיתוח רכיבי פרונטאנד

    הוא אומן על שילוב של פונקציונליות ועיצוב ויזואלי, ומייצר קוד ממשק מדויק ישירות מהוראות טקסט.

  • פתרון בעיות מתמטיקה ולוגיקה

    מספק יכולת היסק עמוקה ברמת תחרויות בלי לחייב פלט ארוך של שרשרת מחשבה.

  • הפעלת פונקציות וכלים

    מגיע לרמת דיוק של כשבעים אחוז בקריאות מבניות לפונקציות גם ללא אימון ייעודי נרחב.

איפה זה נופל

המודל עדיין מוגבל בהפעלת סוכנים מורכבים. הכרטיס מודה בפירוש בבעיות בשיחות מרובות תורות, בניהול זיכרון לטווח ארוך ובשימוש בכלים מתקדמים. קיימת גם בעיית עקביות של סטייה מההנחיות ובלבול זהויות במהלך השיחה. נוסף על כך, מנגנון תשומת הלב מסוג GQA מכביד על משאבי החישוב בהקשרים ארוכים, מה שעלול לייקר משמעותית את זמן התגובה במשימות ניתוח טקסט עמוקות.

שאלות
נפוצות

מה הפרמטרים המומלצים לדגימה בריצה?

המפתחים ממליצים להגדיר טמפרטורה של 0.7 וערך top_p של 0.95 כדי לקבל איזון מיטבי בין דיוק ההיסק למגוון התשובות.

האם אפשר להריץ את המודל על שרת יחיד עם שמונה כרטיסים?

לא, המשקל הכולל של הקבצים עומד על 1.8 טרה בייט בדיוק bfloat16. גם אם דוחסים אותו, מודל של טריליון פרמטרים מחייב פריסה מבוזרת על פני מספר שרתים במקביל.

איך מגיעים לחלון הקשר של 128K טוקנים?

חלון הבסיס הוא 32,768 טוקנים. כדי להגיע לטווח המלא של 128K, יש להגדיר הרחבת YaRN בקובץ התצורה ולהפעיל את הדגל המתאים במנוע ההסקה.

איך מריצים

המשקל הכולל של הקבצים מגיע לכמעט שני טרה בייט בפורמט bfloat16, כך שאין שום אפשרות להריץ אותו על שרת בודד רגיל. פריסה מקומית דורשת קלאסטר רציני, למשל ארבעה שרתים עם שמונה מאיצים גרפיים חזקים בכל אחד, תוך שימוש במנועי הסקה מותאמים כמו SGLang או vLLM עם חלוקת טנזורים מקבילית.

חלון ההקשר המובנה עומד על 32,768 טוקנים וניתן להרחיב אותו עד 128 אלף טוקנים באמצעות מנגנון YaRN. לרוב המוחלט של המפתחים, הקמה ותחזוקה של חומרה כזאת אינן מעשיות, והאפשרות הריאלית היחידה היא שימוש בנקודת קצה של ספק חיצוני או קריאות API ישירות דרך שירות כמו ZenMux.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ling-1T")
print(pipe("שלום"))

הקבצים

165 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והקוד מופצים תחת רישיון MIT. זהו רישיון מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב במוצרים פרטיים בלי תמלוגים, כשהדרישה היחידה היא שמירת הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗