GPT
O

Ornith-1.5-9B-GGUF

קוד פתוח

ornith-aimit2026-08-19

  • transformers
  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF למודל חשיבה של 9 מיליארד פרמטרים שמתמחה בקוד ובסוכנים אוטונומיים. הוא מציג יכולות תכנות שמתחרות במודלים כבדים בהרבה ומיועד להרצה מקומית יעילה.

  • 45.7 GBמשקל הקבצים
  • 3,859,341הורדות בחודש
  • 332לייקים

מה זה

מדובר במודל צפוף של 9 מיליארד פרמטרים שמבוסס על שילוב והמשך אימון של Qwen3.5 ו־Gemma4, תוך שימוש בלולאת שיפור עצמי שמייצרת משימות חדשות ומאמנת עליהן בעזרת למידת חיזוק. כברירת מחדל הוא פועל כמודל חשיבה ופולט בלוקים של תהליך הסקת מסקנות לפני התשובה הסופית, לצד תמיכה מובנית בהפעלת כלים חיצוניים.

במדדי תכנות הוא מציג מספרים חריגים ביחס לגודל שלו. במבחן SWE-bench Verified הוא מקבל 70.6 נקודות, תוצאה שעוקפת את Gemma-4-31B שמגיע ל־52 נקודות, ומתקרבת מאוד למודל כמו Qwen3.6-35B-A3B שעומד על 73.4. במבחן Terminal-Bench 2.1 תחת סביבת Claude Code הוא מגיע ל־47 נקודות מול 18.9 בלבד של Qwen3.5-9B, מה שמראה שהאימון הייעודי שיפר בעיקר את ההתנהלות בסביבות פיתוח ומסוף.

במבחני סוכנים כמו MCP-Atlas הוא משיג 54.2 נקודות, ובמבחן החשיבה GPQA Diamond הוא עומד על 86.4 נקודות. המשמעות היא שאתם מקבלים רמת פתרון בעיות ושימוש בכלים שדורשת בדרך כלל משאבים של מודלים גדולים פי שלושה או ארבעה.

מתאים ל

  • סוכן לתיקון באגים

    תוצאה של 70.6 ב־SWE-bench Verified מאפשרת לו לנתח שגיאות בקוד קיים ולהציע תיקונים מדויקים.

  • אוטומציה של פקודות מסוף

    עם ציון של 47 ב־Terminal-Bench, הוא מתאים להרצת תסריטי פיתוח ותפעול שרתים דרך כלי שורת פקודה.

  • אינטגרציה עם כלי צד שלישי

    תמיכה מובנית במבנה של קריאות פונקציה הופכת אותו למועמד טוב להפעלת ממשקי רשת וספריות חיצוניות.

איפה זה נופל

המודל מתוכנן עם תבנית שיחה ספציפית שדורשת התאמה ידנית של קובץ התבנית, ובלי ההתאמה הזו הביצועים שלו נפגעים. הרחבת חלון ההקשר מעבר לרבע מיליון טוקנים מתבססת על מנגנון סטטי, מה שעלול לפגוע באיכות התשובות בבקשות באורך רגיל. בנוסף, במבחני תכנות מורכבים כמו NL2Repo התוצאה שלו עומדת על 32.4 נקודות בלבד, כך שלא כדאי לסמוך עליו לבניית מאגרי קוד שלמים מאפס בלי בדיקה קפדנית.

אותה משפחה

Ornith-1.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות מול לקוחות בלי לראות את שלבי החשיבה?

כן, שרתי הסקה כמו vLLM מפרידים את שלב החשיבה לשדה נפרד כך שהמשתמש מקבל רק את התשובה הסופית נקייה. אם תרצו, תוכלו לשמור את שלבי החשיבה בצד לצורכי בקרה וניטור בלבד.

האם כדאי להפעיל הרחבת חלון הקשר למיליון טוקנים בכל הרצה?

לא מומלץ. מנגנון ההרחבה פועל בצורה קבועה על כל הבקשות ומוריד את הדיוק של המודל בטקסטים קצרים. תפעילו אותו רק אם המשימה שלכם באמת עוברת את 260 אלף הטוקנים המקוריים.

איך מריצים

המודל המקורי שוקל כ־19 גיגה בייט בפורמט bf16 ודורש מאיץ גרפי בודד עם 80 גיגה זיכרון כדי לפעול עם חלון הקשר מלא של 262,144 טוקנים. גרסת ה־GGUF הזו מחלקת את המשקלים למספר קבצים ומאפשרת לכם לכווץ את דרישות הזיכרון לחומרה מקומית צנועה יותר. קיימת גם גרסת מובייל ייעודית למכשירים ניידים.

אם אתם מריצים שרת עצמאי עם vLLM או SGLang, חובה להשתמש בגרסאות תוכנה עדכניות ולהגדיר מפענחי פלט מתאימים לתגי החשיבה ולקריאות הכלים. כשהעומס דורש חלונות הקשר ארוכים באופן קבוע ואין לכם שרת ייעודי חזק, החזקת תשתית כזו לבד תהיה יקרה ומסורבלת ועדיף להשתמש בנקודת קצה מנוהלת.

ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר לכם להשתמש במודל לצרכים מסחריים, לשנות אותו, לשלב אותו בתוך מוצר סגור ולהפיץ אותו ללקוחות בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור המקוריים של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗