GPT
O

Ornith-1.5-35B-A3B-APEX-MTP-GGUF

קוד פתוח

mudlerapache-2.02026-08-19

  • gguf
  • quantized
  • apex
  • apex-mtp
  • moe

גרסת קוונטיזציה מיוחדת למודל מומחים של 36 מיליארד פרמטרים שמשלבת ראש ספקולטיבי מובנה. היא מתאימה למי שרוצה להריץ מודל בגודל הזה מקומית במהירות גבוהה יותר.

  • 140 GBמשקל הקבצים
  • 63,292הורדות בחודש
  • 89לייקים

מה זה

מדובר במודל MoE עם 256 מומחים מנותבים שמתוכם רק 8 מופעלים בכל טוקן, לצד מומחה משותף שפועל תמיד. המבנה שלו כולל ארבעים שכבות עם תשומת לב היברידית, שמשלבת שלוש שכבות לינאריות על כל שכבה מלאה, וחיבור למודול ראייה. הייחוד בקבצים האלה הוא ראש MTP מובנה שמאפשר פענוח ספקולטיבי ישירות מאותו הקובץ.

שיטת הקוונטיזציה כאן מנצלת את העובדה שרוב המשקלים שייכים למומחים המנותבים. היא שומרת על דיוק גבוה בשכבות הראשונות והאחרונות ובמומחה המשותף, ודוחסת חזק יותר את המומחים באמצע. ראש החיזוי נשמר בדיוק גבוה ברוב הגרסאות כדי לא לפגוע בדיוק החיזוי של הטוקנים הבאים. לא פורסמו כאן מבחני ביצועים, כך שאין נתון רשמי על קצב הטוקנים בפועל.

מתאים ל

  • הרצה מקומית מהירה

    הראש הספקולטיבי המובנה מאיץ את הפקת הטקסט על חומרה מקומית תואמת.

  • עיבוד תמונה וטקסט

    שילוב קובץ הראייה הנפרד מאפשר לנתח תמונות לצד הוראות טקסטואליות.

  • עבודה על כרטיסי מסך ביתיים

    גרסת ה־Compact נכנסת בנפח של פחות מ־18 ג'יגהבייט ומאפשרת שימוש במאיצים נגישים.

איפה זה נופל

כרטיס המודל מודה במפורש שלא בוצעו מבחני תפוקה לקבצים האלה, כך שאי אפשר לדעת מראש כמה טוקנים לשנייה תקבלו על החומרה שלכם. בנוסף, גרסת ה־I-Mini דוחסת גם את ראש הניבוי הספקולטיבי, מה שעלול לגרום לפספוסים ולפגוע ביתרון המהירות שבשבילו הורדתם את הקובץ. לפני שמשלבים אותו במערכת, חובה לבדוק את התמיכה של גרסת ה־llama.cpp שברשותכם בארכיטקטורה הנדרשת.

שאלות
נפוצות

בשביל מה צריך את ראש ה־MTP שמופיע בקבצים?

הראש הזה נועד לפענוח ספקולטיבי שחוזה כמה טוקנים קדימה בכל צעד. הוא מובנה כבלוק ארבעים בקובץ וחוסך את הצורך להחזיק מודל טיוטה נפרד בזיכרון.

איזו גרסה כדאי להוריד מתוך הרשימה?

לכרטיס מסך יחיד עם זיכרון מוגבל כדאי לקחת את Compact או I-Mini. אם יש לכם מספיק זיכרון מעבר ל־26 ג'יגהבייט, Balanced תיתן פשרה טובה בין דיוק למהירות בלי לדחוס את ראש החיזוי.

האם המודל תומך בעיבוד תמונות ישר מהקופסה?

המשקלים של מגדל הראייה מגיעים בקובץ נפרד בשם mmproj.gguf ששוקל 0.9 ג'יגהבייט. כדי לנתח תמונות צריך לטעון אותו לצד קובץ המודל הראשי דרך כלי תומך.

איך מריצים

ההרצה נעשית דרך llama.cpp עדכני עם תמיכה בארכיטקטורת qwen3_5_moe, באמצעות הדגל spec-type draft-mtp לפענוח ספקולטיבי. אם רוצים יכולות ראייה, צריך לטעון בנפרד גם את קובץ הפרוג'קטור ששוקל קצת פחות מג'יגהבייט.

מבחינת חומרה, קובץ ה־Compact שוקל 17.44 ג'יגהבייט ויכול להיכנס לכרטיס מסך ביתי חזק, בעוד גרסאות ה־Balanced וה־Quality דורשות מעל 24 עד 26 ג'יגהבייט של זיכרון תצוגה. אם אין לכם כרטיס עם מספיק זיכרון להחזיק את המודל במלואו, עדיף לפנות ל־API חיצוני מאשר לסבול מביצועים גרועים בגלל זליגה לזיכרון המערכת.

ollama run hf.co/mudler/Ornith-1.5-35B-A3B-APEX-MTP-GGUF:Ornith-1.5-35B-A3B-APEX-MTP-I-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך מוצר, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗