GPT
O

Ornith-1.0-35B-NVFP4-MTP-GGUF

קוד פתוח

s-batmanmit2026-06-26

  • llama.cpp
  • safetensors
  • gguf
  • qwen3_5_moe
  • quantized

גרסת GGUF מכווצת למודל קוד מבוסס תערובת מומחים. היא מיועדת ספציפית לכרטיסי Blackwell של אנבידיה כדי לספק מהירות פענוח כפולה.

  • 262,144טוקנים בהקשר
  • 38.8 GBמשקל הקבצים
  • 6,133הורדות בחודש
  • 39לייקים

מה זה

הבסיס כאן הוא דגם קוד agentic שאומן בחיזוקים על גבי Qwen3.5 MoE, עם 35 מיליארד פרמטרים שמהם רק 3 מיליארד פעילים בכל רגע. לפני התשובה הסופית הוא פולט בלוק של שרשרת חשיבה, ומציג ביצועים שמתחרים ב־Qwen3.6 וב־Gemma 4 במבחני תכנות כמו SWE-bench ו־Terminal-Bench.

מה שמייחד את ההפצה הזו הוא שילוב של שני דברים, כיבוץ ל־4 ביט מסוג NVFP4 או MXFP4, והשתלה ישירה של ראשי חיזוי מרובה טוקנים מדגם אחר ללא אימון מחדש. השילוב הזה נותן דגימה ספקולטיבית שמכפילה את קצב הפקת הטוקנים על חומרה מתאימה, בלי לפגוע בהתפלגות התוצרים.

מתאים ל

  • סוכני פיתוח אוטונומיים

    קצב פענוח של מעל 300 טוקנים לשנייה וחלון גדול מאפשרים הרצה מהירה של בדיקות וקוד בסביבות כמו SWE-bench.

  • הסקה מהירה על שרתי תחנה

    משקל של כ־21 גיגהבייט נכנס במלואו לזיכרון של כרטיס RTX PRO 6000 יחיד ומשאיר מקום נרחב ל־KV cache.

  • מערכות דיבאגינג בטרמינל

    האימון הייעודי סביב Terminal-Bench ובלוק החשיבה המובנה מתאימים לאבחון תקלות ופקודות תשתית מורכבות.

איפה זה נופל

הקבצים האלה חסרי תועלת על חומרת AMD, אינטל או כרטיסי אנבידיה מדורות קודמים, כי החישוב המהיר ב־FP4 נשען ישירות על ליבות הטנזור של Blackwell. בנוסף, חלקי הראייה הוסרו מהקובץ למרות שמילון הטוקנים המקורי נשמר, כך שהוא יודע לעבד טקסט וקוד בלבד. שילוב ראשי ה־MTP אמנם הציג 100 אחוזי קבלה בדגימה דטרמיניסטית, אבל בטמפרטורה של 0.9 אחוז הקבלה יורד ל־75 עד 88 אחוזים ומקטין את יתרון המהירות.

שאלות
נפוצות

האם אפשר להריץ את הקובץ על כרטיסי RTX 4090 או דורות קודמים?

לא. הפורמטים NVFP4 ו־MXFP4 בנויים לעבודה ייעודית מול חומרת Blackwell, ועל כרטיסים ישנים הם לא יעבדו בצורה יעילה. בשביל כרטיסים כאלה צריך לפנות לגרסאות ה־GGUF הרגילות של המודל המקורי, כמו Q4_K_M.

מה ההבדל המעשי בין קובץ ה־NVFP4 לבין קובץ ה־MXFP4?

קובץ ה־NVFP4 משתמש בבלוקים של 16 אלמנטים ובסקייל שברי, מה שמספק שגיאת כיבוץ מעט נמוכה יותר במחיר של גיגהבייט נוסף בנפח. קובץ ה־MXFP4 קטן יותר ושומר על אותה מהירות ריצה בדיוק על גבי Blackwell, כך שלרוב השימושים הפער במבחני דיוק זניח ועומד על פחות מאחוז.

איך מריצים

המודל דורש מעבדי Blackwell מדור sm_120 או sm_121, כמו כרטיסי RTX PRO 6000 או שרתי DGX Spark, יחד עם גרסה 9590 ומעלה של llama.cpp שנבנתה עם תמיכת FP4. על RTX PRO 6000 בודד הוא מגיע לקצב של 310 עד 320 טוקנים לשנייה עם חלון הקשר של 200 אלף טוקנים בשימוש ב־MTP. בשרתי DGX Spark הקצב הכולל יורד לאזור 93 טוקנים לשנייה בגלל מגבלת רוחב הפס של הזיכרון המאוחד.

גרסת ה־NVFP4 שוקלת 21.31 גיגהבייט ומשתמשת בסקייל מדויק יותר שמתאים רק ל־Blackwell, בעוד שגרסת ה־MXFP4 שוקלת 20.30 גיגהבייט ופועלת בתקן פתוח. אם אין לכם גישה למעבדי Blackwell יקרים, עדיף להשתמש ב־API מרוחק או להוריד קוואנטים קלאסיים כמו Q4_K_M למעבדים ישנים יותר.

ollama run hf.co/s-batman/Ornith-1.0-35B-NVFP4-MTP-GGUF:ornith-1.0-35b-MXFP4_MOE-MTP

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT, בדיוק כמו דגם המקור. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו בתוך מוצר סגור, בתנאי שמשאירים את הודעת זכויות היוצרים המקורית. ראשי ה־MTP שנלקחו מ־Qwen מקורם ברישיון Apache 2.0 שמאפשר שימוש כזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗