GPT
R

Ring-2.5-1T

קוד פתוח

inclusionAImit2026-02-10

  • transformers
  • safetensors
  • bailing_hybrid
  • text-generation
  • conversational

מודל פתוח של טריליון פרמטרים שמתמקד בחשיבה מתמטית וסוכנים אוטונומיים. הוא משלב ארכיטקטורת קשב לינארי כדי לאפשר ריצה מהירה יותר ברצפים ארוכים.

  • 1012Bפרמטרים
  • 131,072טוקנים בהקשר
  • 946 GBמשקל הקבצים
  • 4,233הורדות בחודש

מה זה

הפיתוח הזה מציע מודל שפה ענק עם מעל טריליון פרמטרים, אבל מפעיל בפועל 63 מיליארד פרמטרים בכל שלב. ההבדל המרכזי מול מודלים אחרים בסדר הגודל הזה טמון במנגנון הקשב. במקום להסתמך רק על מנגנוני קשב סטנדרטיים, הצוות שילב שכבות של Lightning Linear Attention ביחס של אחד לשבע מול MLA, מה שמוריד את צוואר הבקבוק של הזיכרון ומאיץ את קצב הפליטה פי שלושה ברצפים שעוברים 32 אלף טוקנים.

במבחני חשיבה כבדים הוא מפגין יכולת גבוהה מאוד במתמטיקה תחרותית. לפי בדיקות המפתחים, הוא צבר 35 מתוך 42 נקודות בפתרון מבחני IMO 2025 וציון של 105 נקודות ב־CMO 2025, רמות שמקבילות למדליות זהב. הוא מכוון ישירות לתרחישי קוד מורכבים והפעלת כלים מרובי שלבים, עם ביצועים שהמפתחים מציגים כמתחרים במודלים סגורים מובילים במשימות תכנות וסוכנים.

מתאים ל

  • פתרון בעיות מתמטיקה

    מיועד להוכחות קשות בזכות אימון ייעודי שהביא אותו לציוני מדליית זהב במבחנים בינלאומיים.

  • סוכני תכנות מרובי שלבים

    מבצע ריצות ארוכות במסגרות קוד תודות למהירות יצירה גבוהה ברצפים ארוכים.

  • חיפוש והפעלת כלים

    מתאים לתכנון שרשרת קריאות לפונקציות במערכות מורכבות שדורשות אינטגרציה רחבה.

איפה זה נופל

היוצרים עצמם מודים בכרטיס המודל שהגרסה הזו סובלת מחולשה ביעילות יצירת הטוקנים ומקשיים במעקב מדויק אחרי הוראות. כשמעבירים אותו למשימות מורכבות בעולם האמיתי, היכולת שלו להביא משימות ארוכות טווח לסיום מלא עדיין אינה יציבה ומצריכה שיפור. בנוסף, מדובר במודל שתהליך האימון שלו טרם הסתיים ואין לו עדיין דוח טכני מלא, ולכן חובה לבדוק היטב את אמינות התוצרים שלו לפני שסומכים עליו בתהליכי עבודה אוטומטיים.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת של 8 כרטיסי GPU?

לא בגרסת המשקלים המלאה. עם נפח קבצים של כמעט טרה בייט ב־bfloat16, נדרשים לפחות ארבעה שרתים של שמונה כרטיסי H100 או H200 במקביל כדי להחזיק את המודל בזיכרון.

מה המשמעות של ארכיטקטורת הקשב ההיברידית בפועל?

השילוב בין Lightning Linear Attention ל־MLA מפחית דרמטית את תפיסת הזיכרון של ה־KV Cache. זה מאפשר למודל לייצר תשובות ארוכות מאוד בקצב מהיר בהרבה ממודלים מקבילים בלי להיחנק בזיכרון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־946 ג'יגה בייט בפורמט bfloat16, כך שאין שום אפשרות להריץ אותו על שרת בודד רגיל. דוגמת ההרצה הרשמית של המפתחים דורשת קלאסטר של ארבעה שרתים נפרדים, כשבכל אחד מותקנים שמונה כרטיסי H20 או H200, תוך שימוש ב־SGLang עם חלוקה של Pipeline ו־Tensor Parallelism במקביל.

אם אין לכם תשתית של 32 מאיצים גרפיים מהשורה הראשונה ורוחב פס רשת מהיר מאוד ביניהם, אין טעם להוריד את המשקלים. עדיף להמתין לעליית שירותי ה־API שהובטחו בענן, שכן עלות החומרה הנדרשת להרמה עצמית כבדה מדי לרוב המוחלט של הצוותים.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ring-2.5-1T")
print(pipe("שלום"))

הקבצים

171 קבצים במאגר, 946 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מפורסם תחת רישיון MIT. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי הקוד, הפצה מחדש ושילוב במוצרים פרטיים בלי תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים וכתב הוויתור המקוריים של inclusionAI.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗