GPT
Q

Qwen3.8-Flash-Next-ROCmFP4-FAST-imatrix-GGUF

קוד פתוח

agentionaiother2026-08-28

  • gguf
  • rocmfp4
  • rocmfpx
  • vulkan
  • strix-halo

גרסת קוונטיזציה מיוחדת של מודל ענק עם 180 מיליארד פרמטרים, שנדחסת לזיכרון של חומרה אחודה אחת בלי לגלוש לזיכרון הראשי. הפתרון פונה למי שרוצה ביצועי קצה בלי לשכור חוות שרתים.

  • 175 GBמשקל הקבצים
  • 24,008הורדות בחודש
  • 72לייקים

מה זה

מדובר בגרסה דחוסה של מודל המכיל 180 מיליארד פרמטרים, שעברה התאמה כדי לשבת כולה בתוך 87.06 גיגה בייט של זיכרון גרפי. הדחיסה משתמשת בפורמט מיוחד ברמת ארבע נקודה עשרים ושלוש ביט למשקל, תוך כיול על בסיס טקסט אמיתי. המדידות מציגות עליה של שניים נקודה ארבעים ושמונה אחוז בלבד במדד הפרפלקסיטי בהשוואה למודל המקורי, שזה אובדן דיוק מזערי ביחס לכיווץ הנפח.

הייחוד המשמעותי טמון בביצועים בהקשר ארוך. טבלת החיזוי מפוצלת לפי ראשים ונשארת כולה על המעבד הגרפי, כך שמהירות הקריאה הראשונית מחזיקה מעמד גם בעומק של מאה עשרים ושמונה אלף טוקנים עם מאה שלושים ושבעה טוקנים לשנייה, לעומת מודלים מקבילים שנחנקים כשהטקסט מתארך. בנוסף החבילה כוללת מודול ראייה מלא ומנגנון פענוח ספקולטיבי שמאיץ יצירת טקסט.

מתאים ל

  • סוכנים עם הקשר ארוך

    קריאת מסמכים ענקיים בלולאות עבודה בזכות מהירות קריאה של מאות טוקנים לשנייה בעומק רב.

  • פיתוח מקומי מבוסס תמונה

    הרצת עיבוד תמונה וטקסט מקומית ללא פגיעה באיכות בזכות רכיב ראייה מלא ללא דחיסה.

  • שרת צד לקוח מהיר

    מתאים לתחנות עבודה אחודות הזקוקות לפליטת טקסט של עד ארבעים טוקנים לשנייה עם פענוח מואץ.

איפה זה נופל

החיסרון הגדול ביותר הוא התלות המוחלטת בענף תוכנה לא רשמי. הגרסה המרכזית של לאמה נקודה סי פי פי לא תומכת בשיטת הדחיסה הזו, כך שאתם כבולים לתחזוקה של מפתח פרטי. בנוסף, מנגנון הפענוח המהיר תלוי מאוד בתוכן, כך שקצב הפליטה משתנה באופן חד ולא יציב בקטעי טקסט שונים, וטבלת החיזוי דורשת הגדלה ידנית של זיכרון המטמון כדי למנוע האטה בשיחות ארוכות.

שאלות
נפוצות

האם המודל יעבוד על לאמה נקודה סי פי פי הרגיל?

לא, הגרסה הרשמית לא תומכת בסוג הדחיסה הזה ובמבנה הראשים המפוצל. חייבים לשכפל ולקמפל את הענף הייעודי מגיטהאב עם תמיכה בוולקן.

כמה זיכרון דרוש בפועל בשביל חלון הקשר מלא?

המשקלים תופסים שמונים ושבעה גיגה בייט, ומטמון הטוקנים דורש עוד כשלושה נקודה שניים גיגה בייט במצב דחוס. זה נכנס בדיוק במערכות עם הקצאה של תשעים ושישה גיגה בייט.

מה ההבדל בין קובץ השורש לגרסה בתיקיית וי שתיים?

קובץ השורש מפצל את הטבלה ומאפשר לה לשבת כולה בזיכרון הגרפי לביצועים מרביים. הגרסה השנייה שומרת אותה כטנזור בודד שמאלץ שימוש בזיכרון הראשי של המחשב.

איך מריצים

אי אפשר להריץ את זה על מחשב רגיל או כרטיס ביתי פשוט. המודל תוכנן מראש לחומרת זיכרון אחוד בנפח של מאה עשרים ושמונה גיגה בייט, ספציפית עבור הקצאה של תשעים ושישה גיגה בייט זיכרון גרפי כמו במעבדי רייזן AI מקס פלוס שלוש מאות תשעים וחמש. נדרש קימפול של פיצול ייעודי של לאמה נקודה סי פי פי עם תמיכה בוולקן, כי הגרסה הרשמית עדיין לא כוללת את הפורמט הזה.

קיימות שתי צורות פריסה של הקבצים, האחת מחלקת את הטבלה ומיועדת לרוץ כולה על המעבד הגרפי, והשנייה שומרת אותה כקובץ יחיד הדורש זיכרון מעבד רגיל. אם אין לכם את החומרה המדויקת הזו, אין טעם להסתבך עם הורדה של כמאה ושבעים וחמישה גיגה בייט. במקרה כזה עדיף לקרוא למודל דרך ספק ענן חיצוני.

ollama run hf.co/agentionai/Qwen3.8-Flash-Next-ROCmFP4-FAST-imatrix-GGUF:Qwen3.8-Flash-Next-ROCmFP4-FAST-v2-ple16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון הקהילה של קוון גרסה אחת נקודה אפס, למרות שבמטא דאטה נכתב רישיון אחר. הרישיון מאפשר שימוש מסחרי אך כולל מגבלות שימוש של קוון, בעיקר תקרת משתמשים חודשית שמחייבת בקשת רישיון מיוחד אם אתם עוברים אותה, לכן חובה לבדוק את התנאים המשפטיים לפני שילוב במוצר.

הרישיון המלא בעמוד המודל ↗