GPT
O

Ornith-1.5-35B-A3B-NVFP4

קוד פתוח

ornith-aimit2026-08-18

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • text-generation

זה מודל MoE מכוון קוד וסוכנים שמפעיל רק 3 מיליארד פרמטרים בכל טוקן. הוא נותן חלון הקשר ענק ומתחרה בביצועים של מודלים צפופים גדולים בהרבה.

  • 20Bפרמטרים
  • 262,144טוקנים בהקשר
  • 21.8 GBמשקל הקבצים
  • 792,903הורדות בחודש

מה זה

המודל פותח על בסיס שילוב של Qwen3.5 ו־Gemma4, ועבר אימון בלולאת שיפור עצמי שמייצרת משימות קוד ומחדדת את המדיניות בעזרת למידת חיזוק. הארכיטקטורה שלו מבוססת על מומחים, כך שמתוך סך הפרמטרים הוא משתמש רק בכשלושה מיליארד בכל שלב, מה שמאפשר לו להגיב מהר ביחס לגודל המלא.

במדדי תכנות וסוכנים הוא מציג מספרים יוצאי דופן למשקל שלו, כמו 79 אחוז ב־SWE-bench Verified ו־67.8 ב־Terminal-Bench 2.1. התוצאות האלה מראות שהוא יודע לעבוד בתוך סביבות פיתוח אמיתיות, לתקן באגים במאגרי קוד גדולים ולהריץ פקודות מסוף בלי לאבד את ההקשר.

מתאים ל

  • סוכן לתיקון באגים

    הוא מגיע ל־79 אחוז ב־SWE-bench Verified ומסוגל לנווט במאגרי קוד מורכבים בתוך הקשר של 256K.

  • אוטומציה של מסוף פקודות

    מציג 68.5 ב־Terminal-Bench 2.1 תחת Claude Code ומבין פקודות מערכת ישירות.

  • ניתוח מסמכי קוד ענקיים

    תומך בחלון בסיס של 262,144 טוקנים ומתרחב עד מיליון טוקנים עם YaRN לספריות שלמות.

איפה זה נופל

במדדי היגיון טהורים בלי כלים חיצוניים הוא משיג רק 25.6 ב־HLE, ובמבחנים מורכבים כמו Frontier-Bench v0.1 הוא מגיע ל־5.1 אחוז בלבד. המודל פועל כברירת מחדל במצב חשיבה ארוך שפולט טוקנים של מחשבה לפני התשובה, מה שמייצר זמני תגובה ראשוניים איטיים. בנוסף, כל מבחני הביצועים דורשים התאמות ספציפיות של תבנית השיחה והגדרות דגימה גבוהות, כך ששימוש ישיר בלי הגדרות נכונות ייתן תוצאות נמוכות בהרבה.

שאלות
נפוצות

כמה זיכרון GPU צריך כדי להריץ אותו בפועל?

המשקלים עצמם בכימות NVFP4 תופסים פחות מ־24 גיגה בייט, כך שברמת הקבצים המודל נכנס בכרטיס בודד. הבעיה מתחילה כשטוענים שיחות ארוכות לתוך חלון של 262,144 טוקנים, שם זיכרון ההקשר דורש שני כרטיסי 80GB כדי לא לקרוס. אם השימוש שלכם מוגבל לקטעי קוד קצרים של אלפי טוקנים בודדים, תוכלו להסתפק בחומרה צנועה בהרבה.

האם המודל מחזיר תשובות ישירות או תהליך מחשבה?

הוא מוגדר כמודל חשיבה ופותח כל מענה בבלוק ייעודי לפני פליטת התשובה הסופית. מנועי הרצה כמו vLLM ו־SGLang יודעים לפצל את החשיבה לשדה נפרד בעזרת מפענח מתאים, וכך גם קריאות הכלים מומרות למבנה תקני.

איך מריצים

הגרסה הספציפית הזו שוקלת 21.8 גיגה בייט ומגיעה בכימות NVFP4, מה שמקל מאוד על דרישות האחסון ביחס למשקל המקורי של 70 גיגה בייט ב־bf16. עם זאת, אם רוצים לנצל את מלוא חלון ההקשר שמגיע ל־262,144 טוקנים, תצטרכו חומרה רצינית כדי להחזיק את ה־KV cache, והיוצרים ממליצים על שני כרטיסי 80GB בהרצה מקבילית.

ההרצה מתבצעת דרך vLLM מגרסה 0.19.1 ומעלה או SGLang מגרסה 0.5.9 ומעלה, עם מפענחי כלים וחשיבה מותאמים לפורמט של Qwen3. אם אין לכם גישה למערך כרטיסים כזה ואתם צריכים הקשרים ארוכים, עדיף להשתמש בנקודת קצה מנוהלת דרך שירות חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="ornith-ai/Ornith-1.5-35B-A3B-NVFP4")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו בתוך מוצרים סגורים ולהפיץ אותו הלאה ללא תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗