GPT
L

Ling-lite-1.5

קוד פתוח

inclusionAImit2025-05-11

  • transformers
  • safetensors
  • bailing_moe
  • text-generation
  • conversational

מודל מומחים קטן שמפעיל בפועל רק 2.75 מיליארד פרמטרים בכל מעבר, ומספק מהירות חישוב גבוהה עם ביצועי קוד חזקים מאוד ביחס למשקלו.

  • 17Bפרמטרים
  • 32,768טוקנים בהקשר
  • 31.3 GBמשקל הקבצים
  • 4,710הורדות בחודש

מה זה

מדובר במודל שפה מבוסס תצורת מומחים (MoE) שמכיל סך הכול כמעט 17 מיליארד פרמטרים, אבל מדליק רק חלק קטן מהם בכל טוקן. המשמעות היא שאתם נהנים מקיבולת של מודל בינוני אבל משלמים בזמן ריצה של מודל קטן בהרבה.

במבחני הביצועים הוא מציג נקודת חוזק ברורה בכתיבת קוד עם ציון של 87.27 ב־HumanEval וקריאות לפונקציות ברמה טובה, כשהוא עוקף שם מתחרים ישירים כמו LLaMA3.1-8B. מצד שני, במשימות היגיון מורכבות ומדעים קשים כמו GPQA הוא נעצר סביב 36.55, שזה פחות טוב מדגמים מקבילים של המתחרים מסין.

מתאים ל

  • השלמת קוד מקומית

    תוצאת HumanEval של 87.27 ועלות חישוב נמוכה בזכות ניתוב המומחים מתאימות מאוד לעבודה שוטפת כעוזר פיתוח.

  • חיבור למערכות וכלים

    ציון של 72.15 במבחן BFCL_live מראה שהוא מסוגל להפעיל פונקציות ולהחזיר קריאות API בצורה אמינה.

  • פתרון בעיות מתמטיקה

    עם ציון של 82.62 במבחן Math, המודל יודע להתמודד היטב עם חישובים ואלגברה בסיסית עד בינונית.

איפה זה נופל

יש פער לא מוסבר בין נתוני המטא שמגדירים חלון הקשר של 32,768 טוקנים לבין הטקסט בכרטיס שטוען לעבודה בעד 128K טוקנים. בנוסף, המודל חלש בשאלות ידע כללי ומחקר מתקדם עם 36.55 בלבד ב־GPQA, ואין שום מידע על תמיכה או ביצועים בעברית, כך שסביר מאוד שהוא יתקשה בשפה שאינה אנגלית או סינית.

שאלות
נפוצות

כמה זיכרון וידאו צריך בפועל כדי להריץ אותו?

המשקלים שוקלים 31.3 גיגה בפורמט bfloat16, ולכן צריך לפחות 40 עד 48 גיגה זיכרון וידאו לריצה נקייה עם הקשר סביר. כרטיס ביתי יחיד של 16 או 24 גיגה לא יספיק כאן בלי לדחוס את המודל בקוונטיזציה.

מה אורך ההקשר האמיתי של המודל?

יש סתירה בחומר הרשמי. נתוני המערכת מדווחים על חלון של 32,768 טוקנים, בעוד שבתיאור ובגרפים של הכרטיס נטען לתמיכה בעד 128K, ולכן מומלץ לבדוק אותו בפועל על טקסטים ארוכים לפני שמסתמכים על הטווח המלא.

איך מריצים

כדי להריץ אותו צריך זיכרון וידאו שיכול להחזיק מעל 31 גיגה-בייט של קבצים, מה שמחייב כרטיס מקצועי אחד עם 48 גיגה זיכרון או שני כרטיסי 24 גיגה סטנדרטיים, אלא אם מבצעים קוונטיזציה. המודל נתמך ישירות בספריית transformers בארכיטקטורת BailingMoeForCausalLM.

אם אתם צריכים רק מענה נקודתי בלי לנהל תשתית יקרה, פנייה ל־API חיצוני תהיה זולה ופשוטה יותר מלהחזיק חומרה ייעודית בשביל מודל שדורש נפח כזה רק כדי לשבת בזיכרון.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ling-lite-1.5")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, וזה אומר חופש כמעט מוחלט. אפשר לקחת את המשקלים, לשלב אותם במוצר מסחרי סגור, לשנות אותם ולארח אותם בכל צורה, כשהדרישה היחידה היא לשמור על הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗