GPT
O

Ornith-1.5-35B-A3B-GGUF

קוד פתוח

ornith-aimit2026-08-18

  • transformers
  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

מודל תערובת מומחים של 35 מיליארד פרמטרים שמפעיל רק 3 מיליארד לכל טוקן, ומכוון ספציפית למשימות תכנות וסוכנים עצמאיים. הוא נועד לתת ביצועי קוד חזקים במהירות של מודל קטן בהרבה.

  • 173 GBמשקל הקבצים
  • 3,430,123הורדות בחודש
  • 391לייקים

מה זה

מדובר במודל MoE שנבנה על גבי בסיס של Qwen3.5 ו־Gemma4, עם אימון המשך שמתמקד בשיפור עצמי בלולאה סגורה. המפתחים יצרו מערכת שמייצרת משימות חדשות, בונה פיגומים לפתרון ומעדכנת את המדיניות באמצעות למידת חיזוק. בפועל, הארכיטקטורה מפעילה רק כ־3 מיליארד פרמטרים בכל שלב, מה שמאפשר לו להגיב בקצב מהיר מאוד יחסית לנפח הכולל שלו.

במדדי תכנות הוא מציג מספרים גבוהים מהמקובל בקטגוריה שלו. ב־SWE-bench Verified הוא מקבל 79, וב־Terminal-Bench 2.1 תחת Claude Code הוא מגיע ל־68.5, תוצאות שעוקפות מודלים דחוסים מקבילים כמו Gemma-4-31B וגם גרסאות גדולות בהרבה. המודל פועל כברירת מחדל במצב חשיבה עם תגיות ייעודיות, ומחזיר את תהליך ההסקה בנפרד מהתשובה הסופית כדי לאפשר שילוב בכלים אוטומטיים.

מתאים ל

  • סוכן תכנות אוטונומי

    הוא מגיע ל־79 ב־SWE-bench ומפעיל רק 3 מיליארד פרמטרים, שילוב שנותן ריצה מהירה וזולה בפתרון באגים.

  • ביצוע פקודות בטרמינל

    עם תוצאה של 68.5 ב־Terminal-Bench, הוא מנווט היטב בסביבות פיתוח ואינטראקציה מבוססת שורת פקודה.

  • אינטגרציה עם כלי צד שלישי

    הוא מותאם ישירות לתקשורת דרך MCP-Atlas וכולל מנגנון מובנה לקריאת כלים בפורמט מובנה.

איפה זה נופל

למרות ההצלחה במשימות קוד שגרתיות, במבחנים מורכבים במיוחד הוא עדיין מתקשה. במדד DeepSWE הוא מקבל ציון של 22 בלבד, וב־Frontier-Bench v0.1 הוא נעצר על 5.1, מה שאומר שבבעיות קצה או ארכיטקטורה מורכבת הוא עדיין נכשל ברוב המקרים. בנוסף, מנגנון ההסקה שלו דורש התאמות ספציפיות בתבנית השיחה והגדרות מדויקות במנוע השרת, ואם לא מגדירים אותן נכון מקבלים פלט גולמי ששובר שילובים אוטומטיים.

אותה משפחה

Ornith-1.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו חומרה צריך כדי להריץ אותו עם כל ההקשר?

הכרטיס ממליץ על שני כרטיסי מסך של 80GB כמו A100 או H100. המודל עצמו שוקל כ־70 גיגה בייט ב־bf16, אבל חלון ההקשר המלא של 256K טוקנים דורש תוספת זיכרון משמעותית לפעולה תקינה.

איך המודל מחזיר את שלבי החשיבה שלו?

הוא עובד כמודל הסקה שמייצר בלוקים של חשיבה לפני המענה. כשמגדירים את השרת עם הפרסר הנכון ב־vLLM או SGLang, תוכן החשיבה נשלח בשדה ייעודי נפרד ולא מזהם את התשובה הסופית.

איך מריצים

המשקל הכולל של הקבצים במאגר הזה הוא 173 גיגה בייט המחולקים לעשרה קבצים, כך שלא מדובר בהורדה קלה. בריצת המקור בפורמט bf16 המודל תופס כ־70 גיגה בייט, והמפתחים ממליצים להרים אותו על שני כרטיסי 80GB במקביל כדי לתמוך בחלון הקשר מלא של 256,000 טוקנים. הוא נתמך במנועים כמו vLLM ו־SGLang, ודורש שימוש בפרסרים מתאימים לכלים ולהסקה מובנית.

אם אין לכם שרת עם שתי מאיצי 80GB פנויים, להריץ את זה מקומית בחלון הקשר מלא יהיה כמעט בלתי אפשרי בלי קוונטיזציה כבדה. במקרה כזה, קריאה לשירות ענן שמחזיק את המודל חוסכת את כאב הראש של ניהול זיכרון ה־VRAM העצום.

ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון MIT. זהו רישיון מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של הקוד, הפצה מחדש ושילוב במוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗