GPT
I

INTELLECT-3

קוד פתוח

PrimeIntellectmit2025-11-26

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • prime-rl

מודל הסקת מסקנות בקוד פתוח עם ארכיטקטורת תערובת מומחים של 107 מיליארד פרמטרים. הוא מציג תוצאות גבוהות במיוחד במתמטיקה מתקדמת מול מודלים סגורים וחזקים.

  • 107Bפרמטרים
  • 131,072טוקנים בהקשר
  • 199 GBמשקל הקבצים
  • 8,642הורדות בחודש

מה זה

מדובר במודל שמבוסס במקור על GLM-4.5-Air-Base, ועבר כוונון עדין יחד עם למידת חיזוק בהיקף נרחב. מתוך 107 מיליארד הפרמטרים שלו רק 12 מיליארד מופעלים בכל טוקן, מה שמאפשר לו לרוץ מהר יותר ממודלים צפופים בגודל דומה. הוא כולל חלון הקשר של 131,072 טוקנים שמספיק לניתוח קוד ארוך ומסמכים מורכבים.

במבחני ביצועים הוא בולט בעיקר במתמטיקה טהורה, עם 98.1 במבחן MATH-500 ו־90.8 ב־AIME24, שזה מעל DeepSeek R1 0528 ו־DeepSeek v3.2. עם זאת, במבחני תכנות כמו LCB הוא עומד על 69.3, ובמבחני שאלות מומחים כמו GPQA הוא מקבל 74.4, שזה פחות טוב מחלק מהמתחרים הבכירים בטבלה.

מתאים ל

  • פתרון בעיות מתמטיות

    הוא משיג 90.8 ב־AIME24, תוצאה שמציבה אותו מעל מודלים מתחרים בחישובי לוגיקה ומתמטיקה.

  • הסבר וניתוח הוכחות

    עם תוצאה של 98.1 ב־MATH-500, הוא יודע לפרק בעיות חישוביות לשלבי הסקה ברורים.

  • עיבוד טקסטים טכניים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר להזין תיעוד עמוק ולקבל תשובות מבוססות על ההקשר המלא.

איפה זה נופל

המודל הוכשר לשפה האנגלית בלבד, ואין לו תמיכה רשמית בעברית. בנוסף, במבחן HLE המורכב הוא מקבל 14.6 בלבד, מה שמראה שאלות רב-תחומיות קיצוניות עדיין מקשות עליו. גם בתכנות הוא לא מוביל את הטבלה ומפסיד ל־DeepSeek v3.2, לכן חובה לבדוק היטב את איכות הקוד שהוא מייצר לפני שמסתמכים עליו בפיתוח.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב מקומי או כרטיס RTX ביתי?

לא. משקל הקבצים הוא 199 גיגה-בייט והוא דורש לפחות כרטיס H200 יחיד לגרסת FP8, או שניים לגרסה המלאה. מחשב שולחני רגיל לא מסוגל לטעון כמות כזו של זיכרון גרפי.

האם המודל מתאים לשימוש בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. לא הייתי בונה עליו לשום מוצר שדורש עיבוד או יצירת טקסט בעברית בלי לבדוק אותו קודם בצורה קפדנית.

איך מריצים

המשקל המלא של הקבצים מגיע ל־199 גיגה-בייט, כך שאי אפשר להריץ אותו על שרת פשוט. גרסת ה־BF16 הרגילה דורשת שני כרטיסי H200 ומערך vLLM עם חלוקה בין המעבדים. אם אתם רוצים לחסוך בחומרה, קיימת גרסת FP8 שיכולה לרוץ על כרטיס H200 בודד.

למי שאין גישה לכרטיסים מהסוג הזה בענן או בחוות שרתים, הקמה עצמית תהיה יקרה וכבדה מדי. במקרה כזה, עדיף להמתין לשירותי ענן שיציעו גישה אליו דרך ממשק חיצוני ולא לשכור שרתים ייעודיים רק עבור הניסוי.

from transformers import pipeline

pipe = pipeline("text-generation", model="PrimeIntellect/INTELLECT-3")
print(pipe("שלום"))

הקבצים

59 קבצים במאגר, 199 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT מלא ומתירני. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗