GPT
O

unsloth/Ornith-1.0-35B-GGUF

קוד פתוח

unslothmit2026-07-17

  • gguf
  • unsloth
  • qwen3_5_moe
  • text-generation
  • endpoints_compatible

גרסת GGUF למודל קוד מבוסס תהליכי חשיבה עם 35 מיליארד פרמטרים. הוא מיועד לסוכני פיתוח אוטונומיים שצריכים להריץ פקודות בטרמינל ולתקן באגים מקומית.

  • 493 GBמשקל הקבצים
  • 59,611הורדות בחודש
  • 151לייקים

מה זה

מדובר במודל שפותח במקור על בסיס ארכיטקטורת תערובת מומחים של Qwen 3.5 או Gemma 4, ועבר אימון בלמידת חיזוק כדי לשפר את תכנון המסלול של סוכני תוכנה. הוא פולט בלוק של חשיבה לפני התשובה הסופית ומשתמש בקריאות כלים במבנה מוגדר מראש, כך שכלים כמו קליינטים של OpenAI יכולים לעכל את הפלט ישירות.

במדדי ביצועים של פיתוח קוד, המודל עוקף מודלים פתוחים אחרים בגודל דומה. במבחן Terminal-Bench 2.1 הוא קיבל 64.2 מול 52.5 של Qwen3.6-35B, וב־SWE-bench Verified הוא הגיע ל־75.6 אחוזים. המשמעות היא יכולת גבוהה לפתור בעיות מורכבות במאגרי קוד קיימים ולהתמודד עם משימות ארוכות בלי לאבד את ההקשר.

מתאים ל

  • סוכן טרמינל מקומי

    משיג תוצאה של 64.2 במדד Terminal-Bench ומתאים להרצת פקודות ותיקון שגיאות shell ישירות בסביבת פיתוח.

  • תיקון באגים במאגרי קוד

    מגיע ל־75.6 ב־SWE-bench Verified ויודע לנווט בריפו גדול כדי לזהות ולתקן תקלות מוגדרות.

  • הפעלת כלים באוטומציה

    פולט בלוקים מובנים של קריאות פונקציה שעוברים המרה ישירה למבנה הכלים המוכר של OpenAI.

איפה זה נופל

למרות היכולות בטרמינל, המודל מתקשה ביצירת פרויקטים שלמים מאפס, מה שמשתקף בציון נמוך של 34.6 במדד NL2Repo. בנוסף, מדובר במודל חשיבה שפולט טוקנים רבים של תהליך מחשבה לפני התשובה עצמה, מה שמאט את קצב המענה ומייקר את זמן הריצה. שילוב שלו במוצר דורש התאמה מפורשת של תבנית השיחה והגדרת מפענח מתאים, אחרת הפלט המובנה יישבר.

אותה משפחה

Ornith-1.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו חומרה צריך כדי להריץ את גרסת ה־GGUF במחשב?

המודל מכיל 35 מיליארד פרמטרים. להרצה בכימות של 4 ביט תצטרכו לפחות 24 גיגה-בייט של זיכרון וידאו או זיכרון מערכת מאוחד, וזה עוד לפני שמחשבים את הזיכרון שדורש חלון הקשר ארוך.

האם המודל מחזיר תשובה רגילה או רק תהליך חשיבה?

הוא מתחיל תמיד בקטע של תהליך מחשבה בתוך תגית ייעודית ורק אז עובר לפתרון. צריך להשתמש בשרת שמפרק את הפלט או לחתוך את המחרוזת לפי התגית בסקריפט שלכם.

האם צריך להוריד את כל 493 הגיגה-בייט מהמאגר?

ממש לא. המשקל הכולל נובע מכך שהמאגר מכיל קבצים רבים ברמות דחיסה שונות. אתם בוחרים ומורידים רק את קובץ ה־GGUF היחיד שמתאים לגודל הזיכרון שיש לכם.

איך מריצים

הקובץ הנוכחי מגיע בפורמט GGUF ומיועד לטעינה דרך ספריות כמו llama.cpp, שרת llama-server או Ollama. החבילה כולה במאגר שוקלת 493 גיגה-בייט ומחולקת בין 30 קבצים עבור רמות כימות שונות, כך שמורידים רק קובץ בודד בהתאם לזיכרון הפנוי.

הכרטיס הרשמי מדגים פריסה עם vLLM על שרת של שמונה מאיצי 80 גיגה-בייט במקביליות מלאה כדי לנצל חלון הקשר של 262 אלף טוקנים. אם יש לכם כרטיס גרפי יחיד, עדיף להסתפק בכימות של 4 ביט דרך llama.cpp, או פשוט לצרוך מודלים דרך שירות ענן חיצוני במקום לתחזק שרת כבד.

ollama run hf.co/unsloth/Ornith-1.0-35B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, להפיץ אותו מחדש ולשלב אותו במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצי ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗