GPT
Q

Qwen-3.8-27B-ROCmFP4-FAST-GGUF

קוד פתוח

julianmbapache-2.02026-08-15

  • gguf
  • qwen3
  • qwen
  • 27b
  • rocm

גרסת GGUF בכיול ייעודי לחומרת AMD שמביאה מודל 27B למהירות של מעל 30 טוקנים בשנייה. מתאים למי שמחזיק מעבדי Strix Halo או כרטיסי Radeon ומחפש ביצועים מקומיים גבוהים.

  • 262,144טוקנים בהקשר
  • 86.2 GBמשקל הקבצים
  • 43,559הורדות בחודש
  • 37לייקים

מה זה

הפרויקט הזה לוקח את המודל של עליבאבא וממיר אותו לפורמטים של ארבע ושמונה סיביות, עם התאמה ישירה לארכיטקטורה של מעבדי AMD Strix Halo וכרטיסי Radeon ייעודיים. בניגוד לכיולים סטנדרטיים, נעשה כאן שימוש במנגנון פענוח ספקולטיבי שמנצל את רוחב הפס של הזיכרון כדי להאיץ את הפליטה.

בבדיקות חומרה על מעבד Ryzen AI Max+ 395, גרסת ה־ROCmFP4 מייצרת 14.02 טוקנים בשנייה בפענוח רגיל, ומגיעה עד 36.04 טוקנים בשנייה בקוד וב־JSON תחת מנגנון הפענוח הספקולטיבי. מדובר במהירות מעשית גבוהה מאוד למודל של 27 מיליארד פרמטרים על חומרה מקומית ללא כרטיסי שרת יקרים.

מתאים ל

  • ייצור קוד ו־JSON מהיר

    קצב הפליטה מגיע ל־36 טוקנים בשנייה בתבניות מובנות הודות לפענוח ספקולטיבי מואץ.

  • הרצה מקומית על Strix Halo

    תופס פחות מ־15 גיגה־בייט זיכרון ומשאיר מקום לחלונות הקשר ארוכים על חומרה ניידת.

  • שמירה על פרטיות נתונים

    עיבוד פנימי מלא של מודל חזק בגודל 27B בלי לשלוח מידע רגיש לשרתים חיצוניים.

איפה זה נופל

החיסרון המרכזי הוא התלות המוחלטת בשרשרת הכלים של ROCmFPX ובחומרת AMD תואמת. המודל לא מיועד לסביבות עבודה רגילות מבוססות CUDA, והוא דורש סביבת לינוקס ספציפית עם גרסאות קרנל ודרייברים תואמים. בנוסף, הוא אומן בעיקר על אנגלית וסינית, כך שביצועים בעברית אינם מובטחים ולא נבדקו בחומר הרשמי.

שאלות
נפוצות

האם המודל יפעל על כרטיסי מסך של Nvidia?

לא בצורה אופטימלית. הכיולים והסקריפטים במאגר הזה נבנו במיוחד עבור מנהלי ההתקנים של AMD וארכיטקטורת ROCm, כך שעל כרטיסי Nvidia תאבדו את יתרון המהירות ועדיף להשתמש בקובצי GGUF רגילים.

כמה זיכרון נדרש בפועל לשימוש בחלון הקשר מלא?

לפי בדיקות המאגר, כדי לנצל את כל 262 אלף הטוקנים תזדקקו ל־33.63 גיגה־בייט של זיכרון אחוד או VRAM, שמתוכם כ־20 גיגה־בייט מוקצים עבור מטמון ה־KV.

איך מריצים

כדי להריץ את גרסת ה־ROCmFP4_FAST בגודל 13.55 גיגה־בייט, צריך כרטיס מסך או זיכרון אחוד של לפחות 16 גיגה־בייט, שיספיק לחלונות הקשר בסיסיים של 8K עד 16K טוקנים. אם אתם מכוונים למלוא חלון ההקשר של 262 אלף טוקנים, תזדקקו ל־33.63 גיגה־בייט של זיכרון עבודה רק עבור המודל והמטמון, מה שמחייב מערכות כמו מחשבי Strix Halo עם 64 או 128 גיגה־בייט.

ההרצה מתבצעת ישירות דרך שרת ה־HaloFPX או סקריפט ה־quickstart שבמאגר הייעודי, על גבי דרייבר Mesa RADV Wave64 בלינוקס. מי שמחזיק כרטיס של אנבידיה לא ירוויח מהאופטימיזציות האלה, ועדיף לו לפנות לשרתי ענן או ל־API סטנדרטי במקום להסתבך עם התאמות תוכנה שנועדו ל־ROCm.

ollama run hf.co/julianmb/Qwen-3.8-27B-ROCmFP4-FAST-GGUF:Q3_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי קוד והפצה. אתם יכולים לשלב את הקבצים במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומציינים את השינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗