GPT
L

Ling-lite

קוד פתוח

inclusionAImit2025-02-28

  • transformers
  • safetensors
  • bailing_moe
  • text-generation
  • conversational

מודל תערובת מומחים שמפעיל רק 2.75 מיליארד פרמטרים מתוך כמעט 17 מיליארד בכל שלב. הוא מציג יכולות קוד ומתמטיקה גבוהות ביחס למודלים צפופים בגודל דומה.

  • 17Bפרמטרים
  • 32,768טוקנים בהקשר
  • 31.3 GBמשקל הקבצים
  • 1,849הורדות בחודש

מה זה

מדובר במודל שפת תערובת מומחים בארכיטקטורת BailingMoeForCausalLM. הרעיון פשוט: במקום להעביר כל טוקן דרך כל 16.8 מיליארד הפרמטרים, הוא מנתב אותו ומשתמש בפועל רק ב־2.75 מיליארד בכל רגע נתון. זה נותן מהירות חישוב של מודל קטן עם קיבולת ידע של מודל גדול בהרבה.

לפי המבחנים שהמפתחים פרסמו, גרסת 0415 מנצחת מודלים צפופים פופולריים כמו LLaMA 3.1 8B ו־Qwen 2.5 7B ברוב מדדי החשיבה והתכנות. ב־HumanEval הוא הגיע ל־89.02 אחוז, וב־Math הוא עומד על 79.12 אחוז. במבחן AIME הקשה הוא רושם 13.33 אחוז, נתון נמוך מ־Qwen אבל עדיין סביר לגודל כזה. השיפור הבולט שלו הוא בעיקר במשימות חישוביות ובדיוק לפי הוראות בסיסיות.

מתאים ל

  • השלמת קוד מקומית

    התוצאה של 89 אחוז ב־HumanEval הופכת אותו למנוע טוב לבדיקת פונקציות וקוד בסביבה פרטית ללא שליחת נתונים החוצה.

  • פתרון בעיות חישוב

    עם ציון של 79 אחוז במבחני מתמטיקה, הוא מתאים לניתוח שאלות חישוביות שמכשילות מודלים קלים רגילים.

  • מעקב אחר הוראות מובנות

    במבחן IFEval הוא עבר את 81 האחוזים, מה שמסייע בהפקת תשובות בפורמט קבוע או עבודה מול סכמות.

איפה זה נופל

במבחן התחרותי AIME2024 המודל השיג 13.33 אחוז בלבד, שזה פחות מהמתחרה הישיר Qwen2.5 7B שמגיע ליותר מ־16 אחוז. בנוסף, יש סתירה לא מוסברת בפרסומים לגבי אורך ההקשר, כאשר המפרט הטכני מציין 32,768 טוקנים בעוד שהטבלה בעמוד טוענת ל־128 אלף.

הארכיטקטורה שלו מבוססת על BailingMoe, מה שאומר שספריות הרצה ואופטימיזציה מסוימות עלולות לדרוש התאמות קוד כדי לתמוך בו, ולא הכל יעבוד מהקופסה כמו במודלים המוכרים.

שאלות
נפוצות

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו?

המשקלים תופסים מעל 31 גיגה בייט בפורמט המקורי. צריך לפחות כרטיס של 40 גיגה בייט כמו A100 או זוג כרטיסים קטנים יותר, אלא אם ממירים את המודל לפורמט דחוס כמו 4 ביט.

מה ההבדל בין הפרמטרים הכוללים לפרמטרים הפעילים?

למודל יש כמעט 17 מיליארד פרמטרים שמחזיקים ידע, אבל במנגנון MoE כל מילה שנכנסת מפעילה רק מומחים מסוימים. בפועל המחשב מעבד רק 2.75 מיליארד פרמטרים לטוקן, ולכן הוא מהיר יותר בהסקה ממודל צפוף רגיל.

איזו גרסה של המודל מורידים כרגע?

הגרסה המעודכנת שנמצאת בעמוד הראשי היא Ling-lite-0415, שמציגה ביצועים טובים בהרבה מהגרסה המקורית של פברואר. אם אתם צריכים את הגרסה הישנה, היא זמינה בענף נפרד במאגר.

איך מריצים

כדי להריץ אותו צריך להתמודד עם משקל של 31.3 גיגה בייט בדיוק bfloat16 שמחולקים לעשרות קבצים. זה אומר שאי אפשר להסתפק בכרטיס ביתי פשוט של 16 או 24 גיגה בזיכרון בלי קוונטיזציה. תצטרכו לפחות 40 גיגה בייט של VRAM כדי לטעון אותו ולשמור מקום לטוקנים.

אם אתם לא מחזיקים שרת ייעודי או כרטיס תואם בענן, עדיף להמתין לשירותי API מוכנים שמגישים אותו. היתרון בריצה עצמאית קיים רק אם יש לכם חומרה פנויה ואתם רוצים לנצל את מהירות ההסקה של 2.75 מיליארד פרמטרים פעילים תחת ספריית transformers.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ling-lite")
print(pipe("שלום"))

הקבצים

77 קבצים במאגר, 31.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר חופש פעולה כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע בתוך מוצרים סגורים ולהפיץ מחדש בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗