GPT
O

Ornith-1.0-9B

קוד פתוח

ornith-aimit2026-06-21

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • text-generation

מודל קוד קטן שנועד להרצה עצמית על כרטיס בודד, עם ביצועים שמגרדים מודלים גדולים ממנו בהפעלת כלים ופתרון בעיות אמיתיות במאגרי תוכנה.

  • 1Mפרמטרים
  • 262,144טוקנים בהקשר
  • 17.6 GBמשקל הקבצים
  • 1,464,339הורדות בחודש

מה זה

מדובר בגרסת תשעה מיליארד פרמטרים שמתבססת על ארכיטקטורת Qwen3.5 ומכוונת ספציפית לעבודה כסוכן פיתוח. המפתחים אימנו אותו בלמידת חיזוק כדי שיידע לייצר לא רק את הקוד הסופי, אלא גם את שלבי הביניים והתשתית שמריצה את הבדיקות. הוא פועל כמודל חשיבה שפותח בלוק ייעודי לפני התשובה, ופולט קריאות לפונקציות במבנה תקין.

במבחני ביצועים התוצאות שלו חריגות לקטגוריית המשקל הזו. בבדיקות כמו SWE-bench Verified הוא עומד על 69.4 אחוזים, נתון שכמעט זהה למודל Qwen3.5-35B ומנצח בקלות מתחרים כמו Gemma4-31B. בבדיקות של סביבות עבודה ומסוף דוגמת Terminal-Bench 2.1 הוא מגיע לתוצאה של 43.1, מעל כפול מהגרסה המקורית של Qwen באותו גודל. הוא מציע פתרון טוב למי שרוצה יכולות של מודל ענק בלי להחזיק שרת יקר.

מתאים ל

  • סוכן בדיקות ותיקון באגים

    חיבור ישיר לסביבות עבודה דוגמת OpenHands כדי לאתר שגיאות, לבצע שינויים בקוד ולהריץ בדיקות באופן עצמאי.

  • הפעלת כלי שורת פקודה מקומיים

    שילוב עם כלים כמו OpenCode לצורך ניווט בתיקיות, הבנת מבנה הפרויקט וכתיבת סקריפטים ישירות מהטרמינל.

  • שירות עצמאי לקריאות כלים

    הרצה על שרת פנימי לקבלת פלט מסודר של פונקציות ו־JSON בלי להוציא קוד פנימי של החברה לספקי צד שלישי.

איפה זה נופל

במשימות רב לשוניות מורכבות רואים ירידה ברורה, כאשר ב־SWE-bench Multilingual הציון שלו יורד ל־52 לעומת 60.3 במודל ה־35B. בנוסף, חלון הקשר מלא דורש כוח חישוב משמעותי, ואי אפשר לנצל רבע מיליון טוקנים על כרטיס ביתי פשוט בלי פשרות כבדות על מהירות או כיווץ. המודל גם דורש התאמות ייעודיות לתבנית השיחה והגדרות פרסור ספציפיות כדי שבלוקי החשיבה לא יזהמו את התשובה הסופית, כך שהטמעה שלו דורשת בדיקה קפדנית של זרימת הנתונים.

אותה משפחה

Ornith-1.0 יצא ב־7 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי רגיל?

במשקל מלא של 16 ביט צריך מעל 18 גיגה זיכרון גרפי רק עבור המשקלים, בלי לחשב את חלון ההקשר. כדי להפעיל אותו על חומרה צרכנית של 12 או 16 גיגה, תצטרכו להשתמש בגרסת GGUF מכווצת או בטעינת 4 ביט דרך Unsloth.

איך מטפלים בחלק של החשיבה כדי שלא ישבש את התוכנה שלי?

המודל מוציא את הנימוקים שלו בתוך תגיות ייעודיות לפני התשובה עצמה. ספריות כמו vLLM ו־SGLang כוללות מפענח שיודע להפריד את התוכן הזה לשדה נפרד, או שתוכלו לחתוך את הטקסט באופן ידני לפי תגית הסגירה.

למה לבחור בו במקום במודל המקורי שעליו הוא אומן?

אם המטרה שלכם היא פיתוח תוכנה ושימוש בסוכנים אוטונומיים, האימון הייעודי מקפיץ את הביצועים שלו בעשרות אחוזים מול המודל הבסיסי. הוא פותר תקלות ומפעיל פקודות מערכת ברמה שמתחרה ישירות במודלים כבדים בהרבה.

איך מריצים

המשקל של הקבצים עומד על כמעט 18 גיגה בייט בפורמט המקורי, מה שאומר שהוא נכנס בנוחות על מעבד גרפי יחיד. המפתחים עצמם מציינים מאיץ של 80 גיגה בייט כדי להחזיק את חלון ההקשר המלא של 262,144 טוקנים, אבל אפשר לכווץ אותו לקוונטיזציה של 4 ביט או להריץ גרסת GGUF בזיכרון קטן בהרבה דרך Ollama ו־llama.cpp.

בשרתים מקומיים מריצים אותו דרך ספריות עדכניות של vLLM או SGLang, עם תמיכה מובנית בפירוק בלוקי החשיבה וקריאות הכלים לממשק תואם OpenAI. אם אין לכם חומרה ייעודית או שאתם צריכים לנתח מאגרי קוד ענקיים ברצף בלי לחנוק את השרת, פנייה לשירותי ענן תהיה הגיונית יותר מאחזקת כרטיס שרת מקומי.

from transformers import pipeline

pipe = pipeline("text-generation", model="ornith-ai/Ornith-1.0-9B")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא, שזה הרישיון הכי פתוח שאפשר לבקש. מותר להשתמש בו למוצרים מסחריים, לשנות את המשקלים, לאמן אותו מחדש, לשלב אותו באפליקציות סגורות ולהפיץ אותו ללא תמלוגים או הגבלות אזוריות, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗