GPT
O

Ornith-1.0-35B-FP8

קוד פתוח

ornith-aimit2026-06-26

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • text-generation

זה מודל קוד מבוסס תערובת מומחים שנועד לסוכנים אוטונומיים בסביבות פיתוח ומסוף. הוא מציג חשיבה פנימית וביצועים גבוהים בהרבה מדגמים אחרים בסדר הגודל שלו.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 35.1 GBמשקל הקבצים
  • 533,783הורדות בחודש

מה זה

מדובר במודל MoE עם 35 מיליארד פרמטרים שנבנה מעל בסיס של Qwen 3.5 ועבר אימון בלמידת חיזוק שמתמקד ביצירת פתרונות ובהרכבת סביבת הריצה שלהם במקביל. השוני המרכזי שלו מתחרים בגודל דומה, כמו Gemma 4 או דגמי Qwen המקבילים, הוא התמקדות מוחלטת בעבודה כסוכן. כל תשובה שלו נפתחת בתהליך חשיבה פנימי בתוך תגיות ייעודיות, והוא מיועד להפעיל כלים ולפרק משימות ארוכות לפקודות מעשיות.

במבחני ביצועים ההבדל בולט במיוחד בכל מה שקשור לטרמינל. במבחן Terminal-Bench 2.1 תחת סביבת Terminus-2 הוא מגיע לציון של 64.2, לעומת 52.5 של Qwen3.6-35B ואפילו עוקף את דגם ה־397B של Qwen שעומד על 53.5. במבחן SWE-bench Verified הוא עומד על 75.6 אחוז הצלחה, מה שאומר שהוא מתמודד עם באגים אמיתיים בריפוזיטוריים ברמה שמתקרבת לדגמים גדולים בהרבה ממנו, תוך שמירה על דרישות זיכרון נמוכות יחסית.

מתאים ל

  • סוכן תיקון תקלות עצמאי

    מתאים לשילוב ב־SWE-bench ו־OpenHands בזכות ציון של 75.6 אחוז בפתרון בעיות מעשיות במאגרי קוד.

  • אוטומציה של פקודות מסוף

    מוביל במבחני טרמינל עם ציון 64.2 ומסוגל להריץ סקריפטים מורכבים דרך כלי שורת פקודה.

  • סריקת ריפוזיטורי בהקשר רחב

    תומך בחלון הקשר של 262,144 טוקנים, מה שמאפשר להזין תיעוד פרויקט ומספר קבצים יחד.

איפה זה נופל

המודל פועל כמודל חשיבה בלבד, מה שמייצר תקורת זמנים מורגשת בכל שאילתה. אם אתם מחפשים השלמת קוד פשוטה בשורה בודדת בתוך העורך, הוא יבזבז זמן וטוקנים על שרשרת חשיבה מלאה לפני שיפיק תוצאה. בנוסף, למרות שיש לו הקשר מקסימלי של 262,144 טוקנים, החזקת הקשר כזה בזיכרון בזמן עבודה מול מאגר קוד שלם שואבת משאבי זיכרון קיצוניים. נקודה נוספת שדורשת בדיקה היא ההתאמה לחבילות תוכנה עדכניות, שכן שימוש במודל דורש גרסאות תשתית חדשות מאוד של ספריות כמו Transformers 5.8.1 והתאמת תבניות צ'אט ספציפיות בשרת כדי לפענח קריאות לכלים בלי שגיאות.

אותה משפחה

Ornith-1.0 יצא ב־7 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד או כרטיס מסך בודד?

המשקל ב־FP8 הוא 35.1 גיגה-בייט, כך שהוא לא ייכנס במלואו לכרטיס מסך צרכני רגיל ללא כיווץ נוסף. הרצה בהקשר מלא דורשת שרת חזק, אך ניתן להשתמש בגרסאות מכווצות דרך Ollama או Unsloth על חומרה צנועה יותר אם מוותרים על חלון ההקשר המקסימלי.

איך מפרידים בין תהליך החשיבה לתשובה הסופית בקוד?

המודל פולט את תהליך החשיבה שלו בתוך תגיות ייעודיות. בזמן שרת כמו vLLM ניתן להפעיל מפענח חשיבה שמפצל את הטקסט לשדה נפרד, או לחתוך את המחרוזת עצמאית בקוד לפי תגית הסגירה של בלוק החשיבה.

איך מריצים

המשקל של קובצי המודל בגרסת FP8 עומד על 35.1 גיגה-בייט שמחולקים לשלושים קבצים. כדי להריץ אותו בהקשר מלא של 262,144 טוקנים, דוגמת ההרצה הרשמית של היוצרים דורשת שרת של שמונה מאיצים עם 80 גיגה-בייט כל אחד, תוך שימוש ב־vLLM מגרסה 0.19.1 ומעלה או SGLang מגרסה 0.5.9 ומעלה. אם מריצים אותו מקומית על כרטיס בודד, תצטרכו להגביל את ההקשר בצורה משמעותית או להשתמש בגרסאות מכווצות דרך llama.cpp, Ollama או Unsloth.

אם אתם לא מחזיקים שרת מרובה כרטיסים בארגון, הרצה עצמאית בהקשר המלא תהיה יקרה וכבדה מאוד לתחזוקה. במצב כזה, עדיף להמתין לממשק ענן חיצוני בתשלום לפי טוקן או לצמצם את חלון ההקשר לצרכים המידיים שלכם בלבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="ornith-ai/Ornith-1.0-35B-FP8")
print(pipe("שלום"))

הרישיון

רישיון MIT. אתם יכולים לקחת את המודל, להשתמש בו במוצרים מסחריים, לשנות אותו, להריץ אותו מאחורי ממשק בתשלום או לשלב אותו בתוך תוכנה סגורה בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗