GPT
L

Ling-3.0-flash

קוד פתוח

inclusionAImit2026-08-02

  • safetensors
  • bailing_hybrid
  • text-generation
  • conversational
  • custom_code

ארכיטקטורת MoE היברידית שמפעילה רק 5.1 מיליארד פרמטרים מתוך 124 מיליארד בכל טוקן. הבחירה בו הגיונית אם אתם בונים סוכנים שרצים על הקשרים ארוכים וצריכים זמן תגובה מהיר.

  • 127Bפרמטרים
  • 262,144טוקנים בהקשר
  • 237 GBמשקל הקבצים
  • 17,309הורדות בחודש

מה זה

המודל משלב שכבות Kimi Delta Attention יחד עם Multi-Head Latent Attention ביחס של 5 ל־1, ומחלק את הרשת ל־512 מומחים כשבפועל רק שמונה רצים פר טוקן. השילוב הזה נועד לחסוך זיכרון חישובי ולשמור על מהירות גם בחלון הקשר מלא של 262,144 טוקנים, בלי לדרוש את כוח החישוב של מודל צפוף בגודל הזה.

המפתחים אימנו אותו בלמעלה מעשרת אלפים סביבות אינטראקטיביות, וההתמקדות העיקרית היא ריצה בתוך כלי פיתוח וסוכני רשת כמו Claude Code או Qwen Code. הוא נבדק על בנצ'מרקים של כתיבת קוד כמו SWE-Bench, משימות דפדפן וכלים מבוססי MCP, ומגיע מראש עם מנגנון חשיבה מובנה שמופעל כברירת מחדל.

מתאים ל

  • סוכני פיתוח קוד

    עבודה מול מאגרי קוד גדולים בתוך כלים כמו Claude Code, תוך שימוש ביכולות חשיבה ומעקב פקודות ארוך.

  • מחקר וסריקת רשת מורכבת

    הרצת תהליכי ReAct וסוכנים מרובים שצריכים לסכם היסטוריה ארוכה בלי לאבד את הקשר המשימה המקורית.

  • הפעלת כלים ו־MCP

    מימוש שרשראות קריאה לפונקציות וכלים חיצוניים בזכות תמיכה מובנית בבנצ'מרק MCP-Atlas ופרסר ייעודי.

איפה זה נופל

ארכיטקטורת ה־MoE עם 512 מומחים דורשת תמיכה תוכנתית ספציפית מאוד, ובלי המטמון של SGLang או הגדרות Speculative Decoding ייעודיות, זמני התגובה יפגעו משמעותית. מצב החשיבה המובנה שמופעל כברירת מחדל מייצר כמות טוקנים גדולה לפני התשובה, מה שמאט את הפלט הראשוני ומייקר את הריצה אם אתם משלמים לפי טוקנים. בנוסף, חלון ההקשר המלא דורש משאבי זיכרון קיצוניים גם עם הארכיטקטורה הליניארית, ולא מתאים לעבודה ללא כרטיסים ייעודיים.

שאלות
נפוצות

כמה זיכרון GPU מינימלי צריך כדי להעלות אותו מקומית?

הקבצים שוקלים 237 גיגה בייט, כך שאתם צריכים לפחות 320 עד 640 גיגה בייט של VRAM כדי להחזיק את המודל ולפתוח הקשר רחב. בפועל זה אומר מערך של שמונה כרטיסי H100 או ארבעה כרטיסים של 141 גיגה בייט.

האם אפשר לבטל את מצב החשיבה כדי לקבל תשובות מהר יותר?

כן. מצב החשיבה מופעל כברירת מחדל בטמפלייט, אבל אפשר לבטל אותו ישירות בפרמטרים של הקריאה על ידי שליחת enable_thinking כ־false בבקשת ה־API.

איך מריצים

אי אפשר לדחוף 237 גיגה בייט של משקולות לשרת ביתי. כדי להריץ את גרסת ה־bfloat16 המלאה תצטרכו לפחות ארבעה כרטיסי 141 גיגה בייט כמו H20, או שמונה כרטיסי 80 גיגה בייט מסוג H100, תוך שימוש ב־Tensor Parallel.

ההפעלה מתבצעת דרך vLLM או תמונת דוקר ייעודית של SGLang שתומכת בהאצת MTP ובמטמון הייעודי של הארכיטקטורה. אם אין לכם אשכול שרתים ייעודי בענן שרץ באופן קבוע, זול ופשוט בהרבה לגשת אליו דרך ה־API החינמי של OpenRouter שהמפתחים קישרו אליו.

pip install -U huggingface_hub
hf download inclusionAI/Ling-3.0-flash

הקבצים

39 קבצים במאגר, 237 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר לכם להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש או לשלב אותו במוצרים סגורים, כל עוד אתם שומרים את הודעת זכויות היוצרים והרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗