GPT
O

unsloth/Ornith-1.0-9B-GGUF

קוד פתוח

unslothmit2026-07-17

  • gguf
  • unsloth
  • qwen3_5_moe
  • text-generation
  • endpoints_compatible

גרסת GGUF למודל קוד אוטונומי שמיועד למשימות פיתוח בטרמינל. הוא מציג יכולות חשיבה וקריאה לכלים בסדרי גודל שהיו שמורים בעבר למודלים כבדים בהרבה.

  • 136 GBמשקל הקבצים
  • 433,347הורדות בחודש
  • 61לייקים

מה זה

מדובר במודל צפוף של תשעה מיליארד פרמטרים שאומן בלמידת חיזוק על גבי ארכיטקטורות קיימות כמו Gemma 4 ו־Qwen 3.5. המטרה שלו היא תכנות מבוסס סוכנים, כלומר הבנת הקשר רחב בטרמינל, שימוש בכלים וכתיבת תיקונים עצמאיים. המודל פולט בלוק של חשיבה לפני התשובה הסופית, ומאפשר לחלץ את מהלך המחשבה בנפרד מהקוד עצמו.

במבחני ביצועים הוא עוקף מודלים בגודל דומה באופן עקבי. ב־Terminal-Bench 2.1 תחת סביבת Terminus-2 הוא מגיע לציון 43.1, כפול מ־Qwen3.5-9B וגבוה אפילו מגרסת 35B. ב־SWE-bench Verified הוא מגיע ל־69.4, תוצאה שמתחרה ישירות במודלים של 31 ו־35 מיליארד פרמטרים. המשמעות בפועל היא יכולת לפתור בעיות מאגרי קוד אמיתיים בלי לדרוש תשתית שרתים יקרה.

מתאים ל

  • סוכן טרמינל מקומי

    הרצה בתוך סביבות כמו Claude Code או Hermes לביצוע פקודות אוטומטיות ותיקון שגיאות ישירות מהקונסול.

  • פתרון באגים במאגרים

    שילוב ב־OpenHands לטיפול אוטונומי ב־issues וסגירת תקלות קוד מורכבות ללא תלות ברשת.

  • עבודה מבוססת כלים

    הפעלת פונקציות וקריאות מערכת דרך ממשק דמוי OpenAI עם חילוץ מובנה של פרמטרים במבנה ייעודי.

איפה זה נופל

במשימות של מענה על שאלות תיעוד ופתרון תקלות ב־SWE Atlas, הביצועים שלו נמוכים משמעותית ונשארים באזור 15 עד 17 אחוזים בלבד. בנוסף, חלון ההקשר המלא דורש משאבי זיכרון כבדים שעלולים להאט את ההרצה בקבצים מכווצים. חובה להגדיר מפענחי פלט מיוחדים כדי לסנן את בלוקי החשיבה והכלים, אחרת תקבלו טקסט גולמי ומבולגן.

אותה משפחה

Ornith-1.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו גרסה כדאי להוריד מתוך 27 הקבצים?

הקובץ המתאים תלוי בזיכרון הזמין בכרטיס המסך שלכם. מומלץ לבחור בכיול של 4 או 5 ביט אם יש לכם כרטיס מסך ביתי עם 12 עד 16 גיגה זיכרון, או בכיול 8 ביט אם יש לכם חומרה חזקה יותר.

האם המודל תומך בעבודה עם חלון הקשר מלא במחשב אישי?

המודל תומך עקרונית בהקשר של עד 262 אלף טוקנים, אך הרצה באורך כזה תמלא את הזיכרון במהירות ותאט משמעותית את קצב יצירת הטוקנים. לעבודה יומיומית רגילה על קטעי קוד עדיף להגביל את ההקשר לגודל מעשי יותר.

איך מטפלים בחלק של החשיבה בתשובה?

המודל מוציא את תהליך החשיבה בין תגיות think ייעודיות. אם אתם עובדים מול ממשק תואם OpenAI, השרת מפריד את זה לשדה נפרד, ואם מריצים מקומית בפייתון צריך לפצל את המחרוזת לפי התגית הסוגרת כדי לקבל רק את הפלט הסופי.

איך מריצים

המודל המקורי דורש כ־19 גיגה בייט בפורמט bf16, אבל המאגר הזה מחזיק קובצי GGUF מכווצים שמאפשרים הרצה ישירה ב־llama.cpp או ב־Ollama. הדף כולל 27 קבצים במשקל כולל של 136 גיגה בייט, שמייצגים רמות כיול שונות. לקוחות קצה ומחשבים אישיים עם כרטיס מסך מודרני בעל 12 עד 16 גיגה זיכרון יוכלו להריץ את הגרסאות הקלות בלי בעיה.

אם אתם צריכים להרים שרת ייעודי, vLLM או SGLang דורשים גרסאות תוכנה עדכניות מאוד כמו transformers מעל 5.8.1. כדאי להריץ לבד רק אם יש לכם צורך מובהק בפרטיות קוד או בסביבת פיתוח מקומית מנותקת רשת. אם אתם זקוקים לזמני תגובה קצרים במיוחד תחת חלון הקשר של 262 אלף טוקנים, החומרה המקומית תתקשה ועדיף לפנות לשרת מרוחק.

ollama run hf.co/unsloth/Ornith-1.0-9B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו הלאה, ללא מגבלות אזוריות וללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗