GPT
R

Ring-mini-2.0

קוד פתוח

inclusionAImit2025-09-08

  • transformers
  • safetensors
  • bailing_moe
  • text-generation
  • conversational

מודל תערובת מומחים קומפקטי שמפעיל רק 1.4 מיליארד פרמטרים מתוך 16 מיליארד בכל שלב. הוא מיועד למי שרוצה מהירות חשיבה גבוהה במשימות קוד ומתמטיקה בלי לשלם על מודל כבד.

  • 16Bפרמטרים
  • 32,768טוקנים בהקשר
  • 30.3 GBמשקל הקבצים
  • 313הורדות בחודש

מה זה

מדובר בארכיטקטורת MoE שמבוססת על Ling 2.0 ומאומנת בשיטות חיזוק ייעודיות לשרשראות חשיבה ארוכות. בגלל שרק חלק זעיר מהפרמטרים פעיל בכל טוקן, מקבלים ביצועי חשיבה שמתחרים במודלים צפופים של עד עשרה מיליארד פרמטרים, אבל עם מהירות ייצור שמגיעה למאות טוקנים בשנייה על חומרה מתאימה.

התוצאות במבחנים כמו LiveCodeBench ו־AIME 2025 מראות שהוא מתוכנן לעמוד בעומסי היגיון מורכבים ולא רק לפלוט טקסט שוטף. היכולת להרחיב את ההקשר בעזרת YaRN עד 128 אלף טוקנים מאפשרת לו לנתח קבצי קוד או פלטים ארוכים בלי לאבד את כיוון המחשבה.

מתאים ל

  • פתרון בעיות קוד מורכבות

    האימון על שרשראות חשיבה ארוכות עוזר לו לעקוב אחרי אלגוריתמים מסובכים.

  • ניתוח לוגי במהירות גבוהה

    הפעלת 1.4 מיליארד פרמטרים בלבד מביאה לקצב של מאות טוקנים בשנייה.

  • חישובים והוכחות במתמטיקה

    התוצאות במבחני AIME מעידות על התמקדות מפורשת במשימות היגיון פורמלי.

איפה זה נופל

המודל מפעיל רק 1.4 מיליארד פרמטרים בכל רגע נתון, מה שאומר שקיבולת הידע הכללי שלו צרה מאוד בהשוואה למודלים צפופים גדולים. אם תבקשו ממנו משימות שדורשות הבנה עמוקה של עולם התוכן ולא היגיון אלגוריתמי טהור, הוא יטעה מהר מאוד. בנוסף, חלון הבסיס בהגדרות המודל עומד על כ־32 אלף טוקנים, והרחבה ל־128 אלף דורשת מנגנון אקסטרפולציה שלא בהכרח יתנהג באופן יציב בכל סביבת הרצה.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד חזק עם 32 גיגה ראם?

לא מומלץ בכלל. המשקלים לבדם תופסים מעל שלושים גיגה, וצריך זיכרון נוסף בשביל שכבות הקשר ופעולת המערכת. בשביל מהירות סבירה צריך מעבד גרפי ייעודי עם מספיק VRAM.

מה ההבדל בינו לבין מודל רגיל של 16 מיליארד פרמטרים?

מודל רגיל מפעיל את כל הפרמטרים בכל מילה, ולכן דורש כוח חישוב קבוע וכבד. המודל הזה מפעיל בכל פעם רק חלק זעיר מהרשת, ולכן הוא מייצר טקסט מהר בהרבה.

האם הוא תומך בהקשר של 128K ישר מהקופסה?

ההגדרה הבסיסית בקובצי המודל היא 32K טוקנים. כדי להגיע ל־128K צריך להשתמש בשיטת YaRN שהמפתחים מציינים, מה שדורש הגדרה תואמת בספריית ההרצה שלכם.

איך מריצים

כדי להעלות אותו בזיכרון תצטרכו כרטיס גרפי עם לפחות 40 גיגה זיכרון, כמו A100 או כרטיסים מקבילים, כי קבצי ה־bfloat16 שוקלים מעל שלושים גיגה לפני שמחשבים את זיכרון ההקשר. המפתחים מדדו קצב של מעל 300 טוקנים בשנייה על מאיץ H20, עם אפשרות לחצות את קו ה־500 בעזרת אופטימיזציות מתקדמות.

אם אין לכם שרת ייעודי כזה פנוי בענן או במשרד, עדיף להשתמש בהדגמה שלהם או לחכות לגישה דרך שירות חיצוני, כי ניסיון להריץ 30 גיגה של משקלים על מחשב מקומי פשוט יחנוק את החומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ring-mini-2.0")
print(pipe("שלום"))

הרישיון

הרישיון כאן הוא MIT מלא, וזה המצב הכי נוח שיש. מותר לקחת את המשקלים, לשלב אותם במוצר מסחרי, להריץ אותם בשרתים פרטיים ולשנות את הקוד בלי לשלם תמלוגים ובלי חובת פתיחת קוד מקור, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗