GPT
L

Ling-flash-2.0

קוד פתוח

inclusionAImit2025-09-17

  • transformers
  • safetensors
  • bailing_moe
  • text-generation
  • conversational

מודל תערובת מומחים של 103 מיליארד פרמטרים שמשפעל רק 6.1 מיליארד בכל טוקן. הוא נועד לתת ביצועים של מודל גדול במהירות יצירה גבוהה.

  • 103Bפרמטרים
  • 32,768טוקנים בהקשר
  • 192 GBמשקל הקבצים
  • 2,559הורדות בחודש

מה זה

הארכיטקטורה כאן נשענת על מפתח הפעלה של אחד חלקי שלושים ושתיים, מה שאומר שהרוב המוחלט של המודל נשאר רדום בזמן עיבוד טוקן בודד. המפתחים אימנו אותו על מעל עשרים טריליון טוקנים, והעבירו אותו כוונון עדין יחד עם למידת חיזוק במספר שלבים.

במדדים של חשיבה מורכבת, קוד ומתמטיקה כמו לייבקודבנץ' או איימי 2025, היוצרים מדווחים שהוא עוקף מודלים צפופים של עד ארבעים מיליארד פרמטרים. המשמעות בפועל היא יכולת טובה במשימות פיתוח צד לקוח והיגיון מתמטי, בלי לשלם בזמן תגובה ארוך שמאפיין מודלים צפופים בגודל דומה.

מתאים ל

  • פיתוח קוד וצד לקוח

    מציג תוצאות גבוהות במבחני יצירת קוד ומספק מענה מהיר בזכות מספר נמוך של פרמטרים פעילים.

  • מערכות היסק מהירות

    מגיע למעל מאתיים טוקנים בשנייה על חומרת H20, מה שמתאים לשירותים עם דרישת שיהוי נמוכה.

  • ניתוח פיננסי ורפואי

    נבחן על מבחני ייעודיים כמו הלת'בנץ' ומציג התאמה למשימות היגיון בעולמות מוסדרים.

איפה זה נופל

החיסרון המרכזי הוא התלות בטלאי תוכנה שאינם ממוזגים עדיין לפרויקטים המרכזיים של תשתיות ההרצה, מה שיוצר תחזוקה שבירה בסביבות ייצור. בנוסף, חלון ההקשר הטבעי הוא 32 אלף טוקנים בלבד, והרחבה ל־128 אלף מחייבת שימוש באקסטרפולציית יארן והגדרות ידניות בקובץ התצורה. אין בכרטיס המודל שום מידע על תמיכה בשפות שאינן אנגלית וסינית, כך שחייבים לבדוק מראש את היכולת שלו לעבד עברית.

שאלות
נפוצות

כמה זיכרון וידאו צריך כדי להריץ אותו בפועל?

הקבצים שוקלים 192 גיגה בייט בפורמט המקורי, ולכן צריך לפחות 200 עד 256 גיגה בייט של זיכרון גרפי רק כדי להעלות את המשקלים. בשביל שימוש מעשי עם הקשר ארוך נדרש מערך של כמה כרטיסים כמו שמונה כרטיסי A100 או זוג H20.

איך מרחיבים את ההקשר מעבר ל־32 אלף טוקנים?

צריך לערוך ידנית את קובץ הקונפיג ולהוסיף הגדרת יארן עם פקטור של ארבע. לאחר מכן מפעילים את שרת ההרצה עם פרמטר אורך מותאם.

האם המודל נתמך ישירות בספריות הרצה מובילות?

לא באופן מובנה כרגע. צריך להוריד את קוד המקור של וי־אל־אל־אם או אס־ג'י־לאנג ולהחיל עליו קובץ פאץ' ייעודי שמספקת החברה.

איך מריצים

כדי להחזיק משקל של 192 גיגה בייט בדיוק ביפלוט16 תצטרכו שרת עם מספר כרטיסי מסך חזקים, למשל צמד מאיצים עם זיכרון כולל של מעל מאתיים גיגה בייט, רק כדי לטעון את השכבות לפני חישובי הקשר.

ההרצה המקומית דורשת כרגע התקנה של טלאי ידני לקוד המקור של וי־אל־אל־אם או אס־ג'י־לאנג, כי התמיכה בארכיטקטורה עדיין לא נכנסה לגרסאות הרשמיות. אם אין לכם חומרה ייעודית כזו בענן פרטי ורצון להתעסק עם פאצ'ים של גיט, שווה לבדוק אם יש שירות שמציע גישה ישירה ב־API.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ling-flash-2.0")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון MIT פשוט ומתירני. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לכוונן מחדש ולשלב אותו במוצרים שלכם בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗