GPT
L

Ling-mini-2.0

קוד פתוח

inclusionAImit2025-09-08

  • transformers
  • safetensors
  • bailing_moe
  • text-generation
  • conversational

מודל תערובת מומחים של 16 מיליארד פרמטרים שמפעיל רק 1.4 מיליארד בכל טוקן. הוא מפיק ביצועים של מודל שמונה מיליארד צפוף בחצי מכוח החישוב, לקצב הפקה שמגיע למעל 300 טוקנים לשנייה.

  • 16Bפרמטרים
  • 32,768טוקנים בהקשר
  • 30.3 GBמשקל הקבצים
  • 5,972הורדות בחודש

מה זה

הארכיטקטורה של המודל נשענת על יחס אקטיבציה של 1 ל־32, כך שמתוך 16 מיליארד פרמטרים כוללים, המערכת מפעילה רק 1.4 מיליארד פרמטרים פר טוקן. המפתחים אימנו אותו על מעל 20 טריליון טוקנים בפורמט FP8, ושילבו בו שכבות חיזוי מרובה טוקנים ומנגנוני ניתוב מותאמים. התוצאה היא תפוקה שמתחרה ישירות במודלים צפופים בקטגוריית 8B, אך בעלות חישובית נמוכה משמעותית בזמן היקש.

במדדי חשיבה, תכנות ומתמטיקה כמו LiveCodeBench, CodeForces, AIME 2025 ו־MMLU-Pro, הוא מציג תוצאות שמשתוות למודלים של עשרה מיליארד פרמטרים ומעלה. המשמעות בפועל היא יכולת פתרון בעיות לוגיות מורכבות וכתיבת קוד בלי לשלם בזמני המתנה ארוכים לתשובה.

מתאים ל

  • שרתי היקש עם תעבורה כבדה

    קצב הפקה של מעל 300 טוקנים לשנייה מוזיל משמעותית את עלויות השרתים פר משתמש.

  • ניתוח קוד וסיוע בפיתוח

    ציונים חזקים במבחני LiveCodeBench ו־CodeForces הופכים אותו ליעיל בהבנת לוגיקה.

  • עיבוד מסמכים ארוכים

    יכולת הרחבה ל־128 אלף טוקנים עם YaRN מאפשרת מעבר על מסמכים כבדים בלי לאבד עקביות.

איפה זה נופל

החיסרון המרכזי הוא התמיכה התוכנתית. הארכיטקטורה אינה חלק מהגרסאות הרשמיות של vLLM ו־SGLang, ודורשת טלאי קוד ייעודיים כדי לעבוד. נוסף על כך, תכונת ה־MTP אינה נתמכת בגרסת הצ'אט אלא רק במודל הבסיס. מי שצריך תמיכה טובה בעברית או משימות מקומיות יצטרך לבדוק את הביצועים היטב, שכן נתוני האימון מוטים בעיקר לאנגלית ולסינית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס RTX 4090 בודד?

לא בגרסת ה־BF16 שמגיעה במשקל של 30.3 גיגה. בשביל כרטיס של 24 גיגה תצטרכו להמיר את המודל ל־FP8 או לחלק את הריצה לשני כרטיסים נפרדים עם שרשור טנזורים.

איך מרחיבים את חלון ההקשר מ־32 אלף ל־128 אלף טוקנים?

מגדירים את מקדם YaRN בקובץ התצורה ומפעילים את שרת ה־vLLM עם הפרמטר שקובע את אורך הקלט המרבי. המודל נבדק במבנה הזה ומחזיק זיכרון תקין לאורך כל הטווח.

איך מריצים

כדי להריץ אותו ב־BF16 מלא צריך כרטיס עם לפחות 40 עד 48 גיגה זיכרון גרפי, או שני כרטיסי 24 גיגה בעזרת חלוקת טנזורים. המודל שוקל 30.3 גיגה, כך שכרטיס בודד של 80 גיגה יספק את הביצועים המרביים, במיוחד בהקשרים ארוכים שמגיעים עד 128 אלף טוקנים עם YaRN. קיים גם פורמט FP8 שמפחית את נפח הזיכרון ומאפשר דחיסה לחומרה קטנה יותר.

מי שמשתמש במנועי הסקה כמו vLLM או SGLang יגלה שהתמיכה במבנה BailingMoeV2 עדיין דורשת החלת טלאי ידני על הקוד לפני ההרצה. אם אין לכם שרת ייעודי או סבלנות להגדיר סביבות עם טלאים, עדיף להשתמש בנקודת הקצה של ZenMux בתאימות ל־OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ling-mini-2.0")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לאמן הלאה ולהטמיע במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗