GPT
O

Ornith-1.5-35B-A3B

קוד פתוח

ornith-aimit2026-08-18

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • text-generation

מודל מומחים של 36 מיליארד פרמטרים שמפעיל רק 3 מיליארד בכל טוקן, ומיועד למשימות קוד וסוכנים אוטונומיים. הוא נותן ביצועים של מודלים ענקיים בעלות חישובית נמוכה משמעותית.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 67.0 GBמשקל הקבצים
  • 306,928הורדות בחודש

מה זה

מדובר בארכיטקטורת תערובת מומחים שמבוססת על שלד של Qwen, שבה שומרים 36 מיליארד פרמטרים בזיכרון אבל בפועל רק כעשירית מהם עובדת על כל טוקן. המפתחים אימנו אותו בלולאת שיפור עצמי שמייצרת משימות חדשות ומפתחת אסטרטגיות פתרון בלי להסתמך רק על דאטה ידני של בני אדם, כשברירת המחדל שלו כוללת בלוק חשיבה מובנה לפני התשובה.

במבחני קוד מעשיים הוא עוקף מודלים דחוסים גדולים ממנו בהרבה. ב־SWE-bench Verified הוא מקבל 79, וב־DeepSWE הוא מגיע ל־22 בזמן ש־Qwen 3.6 המקביל עומד על אפס עגול. גם מול Qwen של כמעט 400 מיליארד פרמטרים הוא מוביל ברוב מדדי הפיתוח לסוכנים, מה שאומר שהוא מחזיק תהליכי עבודה ארוכים בסביבות טרמינל בלי להזדקק למפלצת של מאות מיליארדי פרמטרים פעילים.

מתאים ל

  • סוכן בדיקות ותיקון באגים

    התוצאה ב־SWE-bench Verified מראה שהוא מסוגל לנווט בריפו שלם ולתקן באגים אוטונומית.

  • עבודה מול טרמינל

    עם ציון 68.5 ב־Terminal-Bench הוא מצטיין בהרצת פקודות shell ותפעול סביבות פיתוח.

  • אינטגרציית כלים ופונקציות

    הארכיטקטורה מכילה פרסור מובנה לקריאות כלים והוכיחה דיוק גבוה במבחן MCP-Atlas.

איפה זה נופל

במבחני חשיבה כלליים קשים בלי כלים חיצוניים הוא מתקשה, עם 25.6 בלבד ב־HLE. בנוסף, כל מבחני הקוד המובילים שלו הושגו רק תחת טמפרטורה 1.0 וסביבות הרצה ייעודיות שכוללות תבניות צ׳אט מותאמות וחיבור לכלי מערכת. אם תשתמשו בו כמנוע טקסט רגיל או לשיחה כללית בלי תמיכה מפורשת בפרסור קריאות לכלים ובלוקי חשיבה, הביצועים שלו יהיו רחוקים מתוצאות המדידה.

אותה משפחה

Ornith-1.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס בודד של 24 גיגה?

לא בגרסה המקורית ששוקלת 67 גיגהבייט. בשביל להכניס אותו לכרטיס כזה תצטרכו לחכות לגרסאות מקווצות או לוותר על רוב חלון ההקשר.

איך מחברים אותו לכלי פיתוח של סוכנים?

מריצים שרת vLLM או SGLang עם הדגלים שהוגדרו בכרטיס, שממירים את בלוקי המחשבה וקריאות הכלים לממשק תואם OpenAI.

איך מריצים

כדי להריץ אותו צריך להחזיק בערך 70 גיגהבייט בזיכרון הווידאו רק עבור המשקלים בפורמט המקורי, בלי לחשב את חלון ההקשר. בפועל, הרצה מלאה עם הקשר של 256 אלף טוקנים דורשת שני כרטיסי מסך של 80 גיגהבייט כמו שמופיע בהגדרות ההפעלה עם vLLM או SGLang.

אם אין לכם שרת מקומי עם שני כרטיסים כאלה, אין מה לנסות להריץ אותו על תחנת עבודה רגילה בלי קוונטיזציה כבדה. ברגע שצריך הקשרים ארוכים במיוחד, צריכת הזיכרון של ה־KV Cache תחנוק חומרה צנועה יותר, ובמצב כזה עדיף לשלם לפי טוקן דרך שירות חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="ornith-ai/Ornith-1.5-35B-A3B")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי קוד והפצה מחדש, בלי הגבלות על מכירת שירותים שמבוססים עליו, בתנאי שמשאירים את הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗