GPT
L

Ling-3.0-tiny

קוד פתוח

inclusionAImit2026-08-10

  • safetensors
  • bailing_hybrid
  • text-generation
  • conversational
  • custom_code

מודל MoE קומפקטי שמפעיל רק 1.3 מיליארד פרמטרים בכל טוקן, עם מצב חשיבה מובנה ויכולת עבודה על חומרה מקומית כמו מחשבי מק.

  • 7.9Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.7 GBמשקל הקבצים
  • 27,485הורדות בחודש

מה זה

הארכיטקטורה כאן משלבת 128 מומחים דלילים, כאשר כל טוקן מפעיל רק 8 מומחים מנותבים ועוד אחד משותף. השילוב הזה, יחד עם שכבות קשב היברידיות מסוג KDA ו־MLA, מאפשר לשמור על עלות חישוב נמוכה מאוד ביחס לגודל הכולל של הרשת. המודל מגיע עם משקלים בפורמטים של BF16, FP8 ו־INT4, ומציע מעבר גמיש בין שליפת תשובות מהירה לבין פתרון בעיות רב שלבי באמצעות דגל הגדרה יחיד.

במבחני ביצועים של Artificial Analysis הוא קיבל ציון 25 במדד האינטליגנציה וציון 16 במדד הסוכנים. הבדיקות מראות קצב פליטה של מעל 160 טוקנים לשנייה, עם זמן כולל של כ־18 שניות לקבלת תשובה של 500 טוקנים שכוללת את שלב החשיבה המלא. המודל מתמקד במשימות של סוכנים אוטונומיים, קוד, חשיבה מדעית ומתמטית, ומעקב אחר הוראות מורכבות.

מתאים ל

  • סוכן חכם במחשב נייד

    צריכת הזיכרון הנמוכה ב־FP8 מאפשרת להריץ סוכן אוטונומי ישירות על מקבוק בלי צורך בשרת מרוחק.

  • פתרון בעיות מתמטיות וקוד

    מצב החשיבה המובנה מאפשר לנתח שלב אחר שלב שאלות היגיון וכתיבת קוד במחיר חישובי קטן.

  • עיבוד טקסטים ארוכים

    ארכיטקטורת הקשב ההיברידית מתמודדת ביעילות עם מסמכים ארוכים תוך שימוש מועט בפרמטרים פעילים.

איפה זה נופל

הציונים במדדי הסוכנים והאינטליגנציה נמוכים ביחס למודלים גדולים ולא מכוונים להחלפת מערכות ענק במשימות כבדות באמת. ההרצה המקומית ב־Ollama אינה יציבה או רשמית, ומחייבת הידור ידני של pull request. בנוסף, חלון ההקשר הגדול וזמני החשיבה דורשים כוונון ידני של פרמטרי דגימה ספציפיים כדי לקבל תוצאות שאינן נתקעות או מתפזרות.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על מק מיני רגיל?

כן, המפתחים בדקו את המודל על מק מיני ומחשבי מקבוק. בגרסת FP8 ובהקשר של 8K טוקנים, תפיסת הזיכרון מגיעה לכ־8.34 גיגה-בייט, כך שמחשב עם 16 גיגה-בייט זיכרון מאוחד יתמודד איתו היטב.

איך מבטלים את זמן החשיבה הארוך בתשובות פשוטות?

מצב החשיבה מופעל כברירת מחדל בתבנית השיחה. אפשר לכבות אותו בכל קריאת API על ידי העברת הפרמטר enable_thinking שמוגדר כ־false בתוך chat_template_kwargs.

איך מריצים

אפשר להריץ אותו מקומית על מחשבי אפל סיליקון או תחנות מבוססות כרטיסי אנבידיה. במחשב מקבוק עם מעבד M4 Pro ומשקלי FP8, המודל מגיע לקצב של 86 עד 90 טוקנים לשנייה וצורך שיא של 8.34 גיגה-בייט זיכרון בהקשר של 8K טוקנים. על שרתי לינוקס אפשר להרים אותו ישירות דרך SGLang עם תמונת דוקר ייעודית, או לקמפל גרסת פיתוח של vLLM מהקוד.

אם אתם עובדים עם Ollama, התמיכה עדיין לא נמצאת בגרסה הרשמית ודורשת הידור מקומי של ענף ספציפי מגיטהאב דרך MLX. מי שלא רוצה לנהל את השרת והזיכרון בעצמו יכול לפנות ישירות לנקודת הקצה הפתוחה בחינם דרך OpenRouter.

pip install -U huggingface_hub
hf download inclusionAI/Ling-3.0-tiny

הקבצים

43 קבצים במאגר, 14.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים ללא תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗