GPT
O

Ornith-1.0-35B-MTP-APEX-GGUF

קוד פתוח

SC117mit2026-06-27

  • transformers
  • gguf
  • qwen3_5_moe
  • qwen3_5
  • reasoning

מודל קוד סוכן מבוסס תערובת מומחים שמשלב ראייה ממוחשבת. מיועד למי שרוצה ביצועי פיתוח חזקים על חומרה מקומית בלי לחכות לשרתי ענן חיצוניים.

  • 142 GBמשקל הקבצים
  • 6,976הורדות בחודש
  • 79לייקים

מה זה

מדובר בהתאמה של ארכיטקטורת Qwen3.5 שעברה אימון חיזוקים ייעודי לכתיבת קוד עצמאית. המבנה כולל 35 מיליארד פרמטרים בסך הכול, אבל רק 3 מיליארד מתוכם פעילים בכל טוקן נתון בזכות חלוקה ל־256 מומחים. החבילה הנוכחית כוללת קוונטיזציית APEX שמבדילה בין שכבות קריטיות לשכבות אמצעיות, לצד שכבת חיזוי טוקנים מרובה וקובץ mmproj שמוסיף תמיכה בתמונות.

במבחני BenchLocal עם גרסת Compact של 15.85 גיגה בייט, הוא מגיע לציון 100 בקריאות לכלים וסביב 92 עד 93 באיתור באגים. מעניין לראות שמצב ללא חשיבה מפורשת הציג יעילות מעשית של 85.2 לעומת 75.5 במצב חשיבה, בעיקר בגלל פחות ניסיונות חוזרים. המודל מתמודד עם משימות מורכבות של יצירת שלד תוכנה והרצת פתרונות, עם חלון הקשר עצום של 262,144 טוקנים.

מתאים ל

  • סוכן קוד אוטונומי

    ביצועי שיא באיתור באגים ובקריאות לכלים עם צריכת משאבים נמוכה בזמן ריצה.

  • ניתוח ממשקי משתמש

    קובץ הראייה המצורף מאפשר להזין צילומי מסך לצד דרישות פיתוח.

  • פתרון באגים מקומי

    גרסת Mini רצה מצוין על חומרת קצה מודרנית עם 16 גיגה זיכרון גרפי.

איפה זה נופל

למרות השם המרשים, המודל הזה תלוי מאוד בשילוב רכיבים ממקורות שונים, כמו שכבת חיזוי שנלקחה ממודל מקביל כדי לסגור פערים. פער היעילות במבחנים מראה שמצב חשיבה נוטה להסתבך ולהזדקק ליותר ניסיונות תיקון מאשר ריצה ישירה. מעבר לזה, ניצול מלא של חלון ההקשר המלא יצרוך כמות זיכרון עצומה שלא תאפשר הרצה מקומית בכרטיסים סטנדרטיים.

שאלות
נפוצות

איזו גרסת קוונטיזציה כדאי להוריד למחשב פיתוח רגיל?

אם יש לכם כרטיס עם 16 גיגה בייט זיכרון גרפי, גרסת Mini בגודל 13.35 גיגה בייט היא הבחירה הטבעית. אם יש לכם מעט יותר מרווח, גרסת Compact בנפח 15.85 גיגה בייט תיתן יחס מעולה בין דיוק לגודל בלי לחרוג מהזיכרון.

האם חובה להפעיל את מצב הראייה הממוחשבת?

לא, אפשר להריץ את שרת llama.cpp לטקסט בלבד. קובץ הראייה נחוץ רק אם אתם מוסיפים את דגל mmproj כדי לנתח תמונות או ממשקים יחד עם הקוד.

איך מריצים

ההרצה נעשית באמצעות פקודת llama-server פשוטה, עם טעינת המשקלים ישירות לכרטיס המסך דרך ngl 99. גרסת Mini שוקלת 13.35 גיגה בייט ונכנסת בקלות לכרטיס עם 16 גיגה זיכרון כמו RTX 5070 Ti, בעוד גרסת Balanced שוקלת 24.18 גיגה בייט ותדרוש זיכרון רחב יותר.

אם אתם צריכים תמיכה בתמונות לצד קוד, מוסיפים לפקודת ההרצה את הדגל של mmproj-F16.gguf. כדאי להגדיר טמפרטורה של 0.6 עם ערכי top_p של 0.95. אם אין לכם לפחות 16 גיגה זיכרון פנוי בכרטיס המסך, חלון ההקשר הגדול יחנוק את החומרה ומוטב לפנות לפתרון ענן.

ollama run hf.co/SC117/Ornith-1.0-35B-MTP-APEX-GGUF:Ornith-1.0-35B-MTP-APEX-I-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית בתוך מוצרים פרטיים או ציבוריים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗