GPT
O

Ornith-1.5-9B

קוד פתוח

ornith-aimit2026-08-18

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • text-generation

מודל קוד והסקה קומפקטי שמביא יכולות של מודלי ענק לכרטיס מסך בודד. מי שרוצה סוכן תכנות מקומי ועצמאי ימצא כאן שילוב נדיר בין ביצועים לדרישות זיכרון שפויות.

  • 9.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 358,119הורדות בחודש

מה זה

מדובר במודל דחוס עם 9.7 מיליארד פרמטרים שמבוסס על ארכיטקטורת Qwen3.5, ומיועד להסקה ולכתיבת קוד. המפתחים אימנו אותו בלולאת שיפור עצמי שמייצרת משימות חדשות, בונה אסטרטגיות פתרון ומשפרת את המדיניות בעזרת למידת חיזוק, במקום להישען רק על דאטה ידני של בני אדם.

במבחני ביצועים הוא עוקף בקלות את מודל הבסיס Qwen3.5-9B, ובמקרים רבים מתחרה ראש בראש במודלים גדולים ממנו בהרבה כמו Gemma-4-31B. ב־SWE-bench Verified הוא מקבל 70.6 לעומת 53.2 של מודל הבסיס, וב־Terminal-Bench הוא מגיע ל־47 מול 18.9 בלבד. המשמעות בפועל היא יכולת אמיתית לעבוד מול טרמינל, לפתור באגים במאגרי קוד מורכבים ולהריץ סוכנים בלי לגמגם על תחביר בסיסי.

מתאים ל

  • סוכן תכנות לפיתוח מקומי

    משיג 70.6 ב־SWE-bench ומריץ פקודות טרמינל בביצועים שמתחרים במודלים של 30B, ישירות על שרת פנימי.

  • ניתוח בסיסי קוד ענקיים

    תומך בחלון בסיסי של 262K טוקנים ומתרחב עד מיליון, כך שאפשר להזין תיקיות פרויקט שלמות לחיפוש תקלות.

  • אוטומציית משימות מונחית כלים

    כולל פיענוח מובנה של tool calls בתצורת OpenAI ומאפשר הפעלת סוכנים אוטונומיים בסביבות מבוקרות.

איפה זה נופל

המודל פועל כברירת מחדל במצב חשיבה עם בלוקים של think, מה שמאריך את זמן המענה ומייקר את כמות הטוקנים הנפלטים. בנוסף, חלון ההקשר אמנם נמתח עד מיליון טוקנים בעזרת YaRN, אך היישום בספריות הקוד הפתוח הוא סטטי ופוגע באיכות התוצאה בטקסטים קצרים ורגילים. במבחני כלים רחבים כמו Toolathlon-Verified הוא מקבל 41.2 לעומת 52.8 של Gemma-4-31B, כך שסביבות עבודה מרובות כלים מורכבים עדיין מאתגרות אותו.

אותה משפחה

Ornith-1.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לעבוד בלי לפלוט את תהליך החשיבה?

המודל מתוכנן כמודל הסקה ופולט תגיות think כברירת מחדל. שרתי vLLM ו־SGLang כוללים מפענח שמפריד את המחשבות לשדה ייעודי, כך שהמשתמש מקבל ישירות את התשובה הסופית.

כמה זיכרון GPU דרוש כדי לנצל את כל חלון ההקשר?

המשקלים תופסים כ־19GB בזיכרון, אך הקשר של 262,144 טוקנים דורש מקום רב ל־KV Cache. לכן המפתחים ממליצים על כרטיס של 80GB להרצה מלאה.

איך מריצים

המודל שוקל כ־18 ג'יגה־בייט בפורמט bf16. המפתחים מציינים שהוא מיועד להרצה על כרטיס בודד של 80GB, בעיקר אם רוצים לנצל את מלוא חלון ההקשר העצום שלו שמגיע ל־262,144 טוקנים. יש לו גם גרסה מכווצת למכשירים ניידים בשם Ornith-1.5-9B-Mobile למי שצריך לפרוס על הקצה.

ההרצה מתבצעת דרך vLLM החל מגרסה 0.19.1 או SGLang מגרסה 0.5.9, עם תמיכה במפענחי חשיבה וקריאות לכלים. אם אין לכם חומרת שרת כזו בהישג יד, או שאתם לא צריכים הקשרים של מאות אלפי טוקנים באופן קבוע, עדיף לצרוך מודל דרך API חיצוני ולא להחזיק תשתית כבדה.

from transformers import pipeline

pipe = pipeline("text-generation", model="ornith-ai/Ornith-1.5-9B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗