GPT
O

Ornith-1.5-397B

קוד פתוח

ornith-aimit2026-08-18

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • text-generation

מודל מומחים ענק מבית ornith-ai שמתמקד בתכנות והפעלת סוכנים אוטונומיים. הוא מציג ביצועים שמתחרים ישירות במובילי השוק המסחריים, למי שחייב משקלים פתוחים ברישיון חופשי.

  • 403Bפרמטרים
  • 262,144טוקנים בהקשר
  • 751 GBמשקל הקבצים
  • 498,963הורדות בחודש

מה זה

מדובר במודל Mixture-of-Experts המבוסס על ארכיטקטורת Qwen3.5 עם 403 מיליארד פרמטרים, שהורחב מגרסת 1.0 על בסיס Gemma4 ואימון עצמי בלולאה סגורה. היוצרים שילבו אופטימיזציה משותפת של יצירת משימות, בניית מסגרות הרצה ופתרונות מבוססי למידת חיזוק, במקום להישען על מאגרי מידע ידניים.

בפועל, המודל מכוון לרמת מומחה בקוד וחשיבה שלבית, והוא פולט תגיות חשיבה כברירת מחדל לפני התשובה הסופית. במבחני SWE-bench Verified הוא מקבל ציון 86, ובטרמינל תחת Terminus-2 הוא מגיע ל־86.1 נקודות, תוצאה שעוברת את Claude Opus 4.8 שנמדד שם על 85. במבחני סוכנים מרובי כלים כמו MCP-Atlas הוא משיג 80 נקודות, כך שהיכולת שלו לפרק בעיות הנדסיות מורכבות אמיתית לגמרי.

מתאים ל

  • סוכן בדיקות ותיקון קוד

    מתאים לפתרון תקלות עמוקות בריפוזיטורי מקומי, עם ציון של 86 במבחן SWE-bench Verified.

  • ביצוע משימות טרמינל מורכבות

    מיועד להרצת פקודות מערכת עצמאיות בסביבת Harbor או Claude Code, שבהן עקף מודלים סגורים.

  • ניתוח מסמכים טכניים ארוכים

    תומך בחלון הקשר של 262 אלף טוקנים מהקופסה ומתרחב עד מיליון באמצעות מנגנון YaRN.

איפה זה נופל

במשימות מחקר קיצוניות המודל מתקשה בצורה בולטת. במבחן Frontier-Bench v0.1 הוא נעצר על 13.5 נקודות בלבד, רחוק מ־Claude Opus שמגיע ל־21.1 נקודות ומ־Kimi K3 שעומד על 23. בפתרון מאגרי קוד מלאים ב־SWE-bench Pro התוצאה שלו צונחת ל־65.1 לעומת 68 של המתחרה המוביל, והוא דורש שינויים מפורשים ב־chat template של Qwen כדי לשמור על דיוק בהסקה.

אותה משפחה

Ornith-1.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת GPU בודד?

לא בפורמט המקורי. המודל שוקל כ־800 גיגה-בייט בזיכרון, ולכן נדרשים לפחות שמונה כרטיסי H200 של 141 גיגה-בייט או מעבר לגרסאות מכווצות ב־FP8 ו־INT4.

איך המודל מחזיר את שלבי החשיבה?

הוא מייצר בלוקים ייעודיים של תגיות חשיבה בתחילת כל תשובה. בשימוש ב־vLLM או SGLang יש להפעיל את המפענח הייעודי כדי להפריד את שלבי ההסקה מהפלט הסופי.

איך מריצים

משקלי המודל שוקלים 751 גיגה-בייט ודורשים סביבת הרצה של כ־800 גיגה-בייט בפורמט bf16. כדי להרים אותו באופן מקומי צריך שרת של שמונה מאיצי H200 של 141 גיגה-בייט עם חלוקת Tensor Parallelism מלאה, או שימוש בגרסאות מכווצות ב־FP8 ו־INT4 לחומרה צנועה יותר.

המערכת נתמכת בגרסאות vLLM מ־0.19.1 ומעלה או SGLang מ־0.5.9, כולל תמיכה מובנית בחלון ברירת מחדל של 262,144 טוקנים שניתן להרחבה למיליון עם YaRN. אם אין לכם גישה לחוות שרתים ייעודית בעלות של אלפי דולרים בחודש, הרצה עצמית אינה מעשית וכדאי להמתין לחלופות ענן או לספקי גישה מרוחקים.

from transformers import pipeline

pipe = pipeline("text-generation", model="ornith-ai/Ornith-1.5-397B")
print(pipe("שלום"))

הקבצים

138 קבצים במאגר, 751 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון MIT, מה שמקנה חופש מלא לשימוש מסחרי, שינוי קוד, הפצה ושילוב במוצרים קנייניים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים וכתב הוויתור על אחריות בתוך הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗