GPT
G

GRM-3.2-Sky

קוד פתוח

OrionLLMapache-2.02026-07-25

  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational
  • eval-results

מודל מומחים של 35 מיליארד פרמטרים שמפעיל רק 3 מיליארד בפועל, ומכוון לריצות ארוכות של סוכנים אוטומטיים, תכנות מורכב ופתרון בעיות מתמטיקה בלי לאבד את ההקשר.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 65.4 GBמשקל הקבצים
  • 1,169הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמבוסס על ארכיטקטורת תערובת מומחים, עם סך של כ־35 מיליארד פרמטרים אבל רק שלושה מיליארד אקטיביים בכל טוקן. המבנה הזה נותן לו מהירות תגובה וחיסכון במשאבי חישוב בזמן ריצה, לצד חלון הקשר עצום של 262 אלף טוקנים שנועד להחזיק משימות ארוכות ומרובות שלבים.

במבחני ביצועים הוא מציג תוצאות מעולות במתמטיקה ובידע כללי, עם 96.3 ב־AIME26 וציון של 89.5 ב־MMLU-Pro, שבהם הוא עוקף מודלים פתוחים מקבילים. הוא מתמודד יפה עם בדיקות קוד סטנדרטיות כמו SWE-bench Verified שבו קיבל 81.4, כך שהוא יודע לתקן באגים ולעבוד על פרויקטים נקודתיים בצורה אמינה.

מתאים ל

  • פתרון בעיות מתמטיקה

    משיג ציון של 96.3 ב־AIME26 ומספק יכולת ניתוח חישובית חזקה מאוד ביחס לדרישות החומרה הפעילה שלו.

  • תיקון באגים נקודתי בקוד

    מציג 81.4 ב־SWE-bench Verified, מה שמתאים לפתרון בעיות מוגדרות מראש שאינן דורשות סריקה של פרויקט שלם.

  • מענה על ידע מדעי מורכב

    התוצאה של 90.6 ב־GPQA Diamond מוכיחה הבנה מעמיקה בהסברים מדעיים ומענה לשאלות מומחים.

איפה זה נופל

למרות ההבטחות למשימות ארוכות, המודל מתרסק במבחני סוכנים אמיתיים שדורשים רצף פעולות עמוק. ב־DeepSWE הוא מגרד ציון של 19.5 בלבד, הרבה מאחורי מודלים מובילים שמגיעים ליותר מ־50 ו־60. גם ב־Terminal-Bench הוא נעצר ב־66.3, ובמחולל מאגרי קוד שלמים הוא עומד על 35.6. לא הייתי מפקיד בידיו סוכן אוטונומי שאמור לרוץ שעות בטרמינל בלי השגחה צמודה, כי הוא נוטה לאבד שליטה כשמורכבות המשימה נמתחת על פני שלבים רבים.

שאלות
נפוצות

האם המודל מתאים לפיתוח סוכן עצמאי שיבצע משימות תכנות מורכבות מקצה לקצה?

לא ממש. הנתונים מראים נפילה חדה ב־DeepSWE עם ציון של 19.5, כך שבמשימות שדורשות תכנון ארוך ושימוש ממושך בכלים הוא מתקשה להחזיק מעמד לבד.

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו מקומית?

הקבצים שוקלים 65.4 גיגה בייט, ולכן צריך כרטיס בודד של 80 גיגה או שילוב של שני כרטיסי 48 גיגה, במיוחד אם רוצים לנצל את חלון ההקשר המלא.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־65.4 גיגה בייט, מה שאומר שצריך לפחות כרטיס תצוגה מקצועי עם 80 גיגה זיכרון כדי לטעון אותו ישירות בלי קוונטיזציה. בגלל שרק שלושה מיליארד פרמטרים פעילים, מהירות ייצור הטוקנים גבוהה משמעותית ממודל רגיל באותו נפח, אבל צוואר הבקבוק נשאר הזיכרון שנדרש כדי להחזיק את כל המשקלים וחלון הקשר גדול.

אם אין לכם שרת ייעודי או קלאסטר מתאים בענן, להרים אותו עצמאית זה כאב ראש יקר. במקרה כזה, עדיף בהרבה להשתמש בנקודת קצה מנוהלת או ב־API חיצוני, במיוחד כשרק בודקים התאמה למערכת ולא רוצים להתחייב לחומרה כבדה.

pip install -U huggingface_hub
hf download OrionLLM/GRM-3.2-Sky

הרישיון

המודל מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בענן פרטי ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗