GPT
R

Ring-1T

קוד פתוח

inclusionAImit2025-10-10

  • transformers
  • safetensors
  • bailing_moe
  • text-generation
  • conversational

מודל MoE פתוח של טריליון פרמטרים שמיועד למשימות חשיבה עמוקה, מתמטיקה ותכנות תחרותי. פונים אליו כשצריכים יכולות היסק ברמת מערכות סגורות מובילות אבל דורשים משקלים פתוחים בקוד.

  • 1000Bפרמטרים
  • 65,536טוקנים בהקשר
  • 1.8 TBמשקל הקבצים
  • 353הורדות בחודש

מה זה

מדובר במודל שפותח על בסיס ארכיטקטורת Ling 2.0 ומכיל טריליון פרמטרים בסך הכול, מתוכם 50 מיליארד פעילים בכל טוקן נתון. הצוות אימן אותו בלמידת חיזוק באמצעות אלגוריתם בשם Icepop שנועד למנוע קריסה של תהליך האימון בריצות ארוכות, יחד עם מערכת תגמולים שמריצה קוד בסביבות מבודדות.

במבחנים מול מודלים סגורים, הוא פתר ארבע מתוך שש בעיות באולימפיאדת המתמטיקה הבינלאומית 2025 בניסיון ראשון, ובגמר תחרות התכנות ICPC 2025 פתר חמש בעיות מתוך שלוש ניסיונות. התוצאות האלה מראות שהוא מסוגל להתמודד עם שרשראות היסק ארוכות ומורכבות בלי להישבר, בניגוד למודלים פתוחים קטנים יותר שנוטים לאבד עקביות בהוכחות מורכבות.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוכחת משפטים ופתרון בעיות ברמת אולימפיאדה בזכות אימון ייעודי על למידת חיזוק עם אימות.

  • פתרון אתגרי תכנות מורכבים

    כתיבת אלגוריתמים לתחרויות קוד כמו ICPC ו־Codeforces שדורשים חשיבה לוגית מעבר להשלמת קוד.

  • מחקר על מערכות חשיבה

    בדיקת תהליכי היסק של מודלי שפה בנפח של טריליון פרמטרים על תשתית שרתים פנימית.

איפה זה נופל

היוצרים מציינים במפורש שהמודל סובל מבעיות של הטיה בזיהוי זהות, ערבוב שפות במהלך התשובה ונטייה לחזרתיות מיותרת בפלט. מכיוון שמנגנון הקשב שלו מבוסס על ארכיטקטורת GQA סטנדרטית, יעילות הריצה צונחת בצורה חדה כשעובדים עם הקשרים ארוכים שמתקרבים לגבול ה־128 אלף טוקנים. מעבר לזה, אין שום התייחסות לתמיכה בעברית, כך שסביר להניח ששפת המקור והיכולות נשענות כמעט לגמרי על אנגלית וסינית.

שאלות
נפוצות

אפשר להריץ את המודל על שרת ענן עם שמונה כרטיסי H100?

לא. המשקלים בפורמט הרגיל תופסים 1.8 טרה-בייט ומחייבים לפחות 32 מאיצים במקביל לחלוקת הזיכרון. תצטרכו להשתמש בגרסת FP8 וגם שם תזדקקו לקלאסטר מרובה צמתים.

איך מומלץ להגדיר את פרמטרי הדגימה של המודל?

המפתחים ממליצים להריץ אותו עם טמפרטורה של 0.6 וערך top_p של 0.95 כדי לאזן בין גמישות המחשבה לבין דיוק לוגי.

איך המודל מתמודד עם טקסטים ארוכים מעבר ל־65K טוקנים?

חלון הבסיס מוגדר ל־65,536 טוקנים, אבל אפשר להרחיב אותו עד 128,000 טוקנים באמצעות מנגנון YaRN והגדרת rope_scaling בקובץ התצורה.

איך מריצים

אי אפשר להרים את המודל הזה על שרת ביתי או על מכונה בודדת עם כמה כרטיסים. קבצי המשקלים לבדם שוקלים 1.8 טרה-בייט בפורמט bfloat16, וכדי להריץ שרת אינפרנס באמצעות SGLang או vLLM תצטרכו קלאסטר של לפחות 32 מאיצים גרפיים שמחוברים ביניהם ברוחב פס גבוה, למשל ארבעה צמתים של שמונה כרטיסים כל אחד.

קיימת גרסה מכווצת בפורמט FP8 שמקטינה את דרישות הזיכרון, אבל היא עדיין דורשת מערך שרתים ארגוני כבד. אלא אם אתם ארגון שמחזיק חוות שרתים ייעודית ומחויב לפרטיות מוחלטת של המידע, הדרך ההגיונית היחידה לעבוד איתו היא שליחת בקשות לנקודת הקצה של ה־API המסחרי שמסופק דרך ZenMux באמצעות ספריית OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ring-1T")
print(pipe("שלום"))

הקבצים

170 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט פורסם תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗