GPT
O

Ornith-1.0-9B-MTP-GGUF

קוד פתוח

protoLabsAImit2026-06-27

  • gguf
  • llama.cpp
  • speculative-decoding
  • mtp
  • multi-token-prediction

גרסת GGUF למודל תשעה מיליארד פרמטרים שכוללת ראש חיזוי מובנה. היא מיועדת למי שרוצה מהירות דגימה גבוהה במיוחד בתוך llama.cpp בלי להגדיר מודל טיוטה נפרד.

  • 66.3 GBמשקל הקבצים
  • 7,615הורדות בחודש
  • 95לייקים

מה זה

הבסיס כאן הוא כוונון של Qwen3.5 שמשלב שכבות קשב ליניאריות עם שכבות מלאות, ואליו הוצמד ראש לחיזוי רב טוקנים שעבר זיכוך KL. המשמעות הטכנית היא שמנוע ההרצה מייצר מספר טוקנים קדימה ומאמת אותם במקביל במעבר יחיד, מה שמקצר את זמן ההמתנה בין טוקנים ומעלה את קצב הייצור בצורה חדה.

בבדיקות ביצועים על RTX A6000 עם קוונטיזציה של שמונה ביט, הקצב עלה מ־71 טוקנים לשנייה ל־122.6 טוקנים לשנייה בעומק חיזוי של שלושה טוקנים, שיפור של פי 1.73 עם יחס קבלה של 65 אחוזים. על ארכיטקטורת Blackwell של אנבידיה עם גרסת NVFP4, המודל רשם 306 טוקנים לשנייה בממוצע, כיוון שאימות החיזוי רץ ישירות על ליבות הטנסור בלי עלות החישוב של פריסת הקוונטיזציה.

מתאים ל

  • השלמת קוד מקומית בזמן אמת

    קצב ייצור הטוקנים מגיע לשיא במשימות קוד צפויות, מה שנותן חוויית עריכה מיידית בסביבת הפיתוח.

  • שרתי ממשק אינטראקטיביים

    החיסכון בזמן תגובה לטוקן ראשון ושני מאפשר שיחה רציפה בלי להחזיק תשתית ענק של כרטיסי מסך.

  • הרצה בקצה על חומרה רזה

    גרסאות הדחיסה הנמוכות כמו IQ2_M דורשות רק כחמישה גיגה זיכרון ומחזיקות שיעור קבלה סביר.

איפה זה נופל

החיזוי המקבילי אינו מייצר פלט זהה ברמת הביטים לעומת ריצה רגילה אפילו בטמפרטורה אפס, בגלל שינוי בסדר פעולות החישוב של הנקודה הצפה במהלך אימות המנות. קצב קבלת הטוקנים תלוי בסוג המשימה, ובטקסטים יצירתיים המהירות יורדת מ־330 טוקנים לשנייה ל־287. נוסף לכך, גרסאות ישנות של Ollama נכשלות בריצה עם שגיאת חוסר שכבות קשב.

שאלות
נפוצות

האם חייבים להוריד שני קבצים כדי שהחיזוי המהיר יעבוד?

לא. רוב הקבצים כאן מגיעים מאוגדים יחד עם ראש ה־MTP בתוך אותו קובץ GGUF. רק קובץ ה־standalone head שנמצא בתיקיית המשנה מיועד לחיבור ידני למודל בסיס חיצוני באמצעות הדגל model-draft.

למה עדיף לבחור בגרסת Q4_K_M ולא ב־NVFP4 על כרטיסים ישנים?

פורמט NVFP4 מתוכנן לליבות הטנסור של ארכיטקטורת Blackwell בלבד. בכרטיסים ישנים יותר כמו סדרת Ampere, פעולת האימות בפורמט הזה דורשת פריסה חישובית כבדה שמאטה את הקצב ל־84.8 טוקנים לשנייה לעומת 153.4 בקוונט המסורתי.

מה הערך המומלץ לדגל spec-draft-n-max בהפעלה?

בדיקות החומרה מראות שערך 2 נותן את שיעור קבלת הטוקנים הגבוה ביותר של כ־76 אחוזים, בעוד שערך 3 מניב את קצב הייצור המרבי. מעבר ל־4 טוקנים קדימה הביצועים מתחילים לסגת בגלל דחיות מרובות של טוקנים.

איך מריצים

להרצה מקומית משתמשים בגרסה עדכנית של llama.cpp החל מגרסה b9616 שמזהה את ארכיטקטורת qwen35. הפקודה מפעילה את llama-server עם הדגל spec-type draft-mtp ומשקל שמכיל את הראש המובנה. בחומרה מבוססת Ampere כמו A6000 בוחרים בקובץ Q4_K_M ששוקל 5.8 גיגה בייט, ובחומרה מסדרת Blackwell בוחרים בגרסת NVFP4 בגודל 6.6 גיגה בייט.

כרטיס גרפי יחיד עם 8 עד 12 גיגה זיכרון יספיק לרוב הגרסאות המכווצות. אם אין לכם גישה לכרטיס מתאים או שאתם לא צריכים שליטה מלאה בזיכרון המקומי וקצבי שיא של מאות טוקנים, תשתית מנוהלת דרך ענן תחסוך את כאב הראש שבתחזוקת גרסאות בינאריות ייעודיות.

ollama run hf.co/protoLabsAI/Ornith-1.0-9B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT שמאפשר שימוש מסחרי, שינוי, הפצה והטמעה בכל מוצר סגור או פתוח. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה. אין מגבלות על מספר משתמשים או הכנסות ממוצרים שמשתמשים בו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗