GPT
R

Ring-mini-linear-2.0

קוד פתוח

inclusionAImit2025-09-24

  • transformers
  • safetensors
  • bailing_moe_linear
  • text-generation
  • moe

שילוב של תשומת לב לינארית ומבנה מומחים דליל שמפעיל רק 1.6 מיליארד פרמטרים מתוך 16.4 מיליארד. הוא מיועד למי שצריך היקש מהיר בהקשרים ארוכים בלי לשלם בזמן חישוב כבד.

  • 16Bפרמטרים
  • 131,072טוקנים בהקשר
  • 30.6 GBמשקל הקבצים
  • 2,826הורדות בחודש

מה זה

הארכיטקטורה משלבת שכבות של תשומת לב לינארית עם תשומת לב רגילה לצד מבנה תערובת מומחים. מתוך 16.4 מיליארד פרמטרים, המודל מפעיל רק 1.6 מיליארד בכל טוקן, יחס שפעול של אחד חלקי שלושים ושתיים. הבסיס שלו מגיע מאימון המשך של שש מאות מיליארד טוקנים על גבי מודל בסיס קודם של אותה סדרה.

המטרה כאן היא לפתור את צוואר הבקבוק החישובי של טקסטים ארוכים. המפתחים מדווחים על ביצועים שמגרדים מודלים צפופים של שמונה מיליארד פרמטרים כמו קוון שלוש, במבחני חשיבה, מתמטיקה ותכנות, תוך שמירה על זיכרון יציב ומהירות יצירה גבוהה.

מתאים ל

  • עיבוד מסמכים ארוכים באנגלית

    תשומת הלב הלינארית מאפשרת לעבד נפחי טקסט עצומים בלי שהזיכרון יקרוס ביצירת הפלט.

  • משימות תכנות ומתמטיקה

    המבחנים מראים יכולות היקש שמתחרות במודלים מקבילים תוך הפעלת עשירית מכמות הפרמטרים.

  • שרתי היקש עם תפוקה גבוהה

    יחס שפעול נמוך של מומחים מאפשר יצירת טוקנים בקצב גבוה משמעותית ממודלים צפופים.

איפה זה נופל

המודל תומך רשמית באנגלית בלבד, ואין שום תיעוד או בדיקות לגבי יכולות בעברית. בנוסף, הארכיטקטורה המותאמת אישית מונעת שימוש בכלים סטנדרטיים של אופטימיזציה כמו זיכרון מטמון מבוסס רדיקס או קיצוץ תחיליות, ושתיהן מבוטלות מפורשות בהגדרות הריצה של המפתחים.

שאלות
נפוצות

האם המודל יפעל ישירות בגרסה הרגילה של vLLM?

לא בשלב זה. המפתחים מציינים שהשינויים טרם הוטמעו בגרסה הרשמית, ולכן צריך להתקין חבילה מותאמת אישית של המנוע מקובץ ייעודי.

מה היתרון של שילוב תשומת לב לינארית?

היא מפחיתה את העומס החישובי והזיכרון הדרוש לשמירת ההקשר, מה שמאפשר לטפל בהקשר של מעל מאה אלף טוקנים בלי איטיות קיצונית.

האם כדאי לבנות עליו שירות שפונה למשתמשים בישראל?

לא כברירת מחדל. כרטיס המודל מגדיר אנגלית כשפה היחידה, כך שכל עיבוד של עברית עשוי להניב תוצאות לא אמינות בלי בדיקה מקיפה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך שיכול להחזיק מעל שלושים ג'יגה בייט של משקלים, בדרך כלל כרטיס בודד של ארבעים ושמונה ג'יגה בייט או שמונה מאות, אחרת תצטרכו לחלק אותו בין שני כרטיסים צרכניים. הוא מוגדר בפורמט בי פלואוט שש עשרה ודורש קוד מרוחק וספריות ייעודיות כמו פלאש לינאר אטנשן.

ההטמעה במסגרות היקש דורשת כרגע התקנה של קובצי גלגל לא רשמיים, כי התמיכה במנועים כמו וי אל אל אם או אס ג'י לאנג עדיין לא ממוזגת במלואה לענפים הראשיים. אם אתם מחפשים משהו שעובד בלחיצת כפתור בסביבת שרת פשוטה, זה ידרוש תחזוקה ידנית של סביבת הפייתון.

from transformers import pipeline

pipe = pipeline("text-generation", model="inclusionAI/Ring-mini-linear-2.0")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית של inclusionAI. אין הגבלות שימוש נוספות מעבר לזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗