GPT
Q

Qwen3.8-27B-ROCmFP4-STRIX-MTP-GGUF

קוד פתוח

kingjones777apache-2.02026-08-14

  • gguf
  • llama.cpp
  • rocm
  • amd
  • rocmfp4

גרסת קוונטיזציה מיוחדת של מודל ענק למעבדי AMD Strix Halo עם שילוב ראש חיזוי מובנה. היא נועדה להפיק מהירות פענוח גבוהה במיוחד על חומרה ספציפית זו.

  • 98.2 GBמשקל הקבצים
  • 38,625הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל שפה של עשרים ושבעה מיליארד פרמטרים שקודד בפורמט ROCmFP4 עבור מאיצי AMD. הייחוד העיקרי כאן אינו רק הדחיסה לנפח של קצת פחות מארבעה עשר גיגה בייט, אלא שילוב ראש חיזוי מרובה תווים שמאיץ את ייצור הטקסט. הנתונים מראים קצב של שלושים תווים לשנייה בהקשר של שמונה אלפים, שזה פי שניים נקודה שמונה מגרסת קוונט רגילה. רמת הפרפלקסיטי נשמרת על חמש נקודה שמונה ושמונה, ערך זהה למעשה למודל רגיל וגדול יותר.

המבנה הפנימי של המודל משלב שכבות קשב מלאות עם שכבות לינאריות, מה שמשאיר את זיכרון ההקשר רזה גם באורכים גדולים. במבחני הפעלת כלים המודל קיבל שבע מתוך שבע, כולל מקרים של שימוש בחשיבה ובקשות מקבילות באותה שיחה. יש כאן גם תמיכה ברכיב ראייה שנבדק בהצלחה בהצבת אלמנטים במרחב.

מתאים ל

  • הפעלת סוכנים עם כלים

    מבצע קריאות מקבילות לכלים בהצלחה ומחזיר מבני נתונים מדויקים גם כשרכיב החשיבה עובד.

  • מענה טקסט מהיר מקומית

    קצב ייצור הטקסט חוצה את תקרת רוחב הפס ומגיע לשלושים תווים בשנייה בחומרה נתמכת.

  • ניתוח תמונות משולב

    כולל רכיב עיבוד ראייה שנבדק ונמצא מדויק בזיהוי מיקומים בלי לפגוע במהירות הריצה.

איפה זה נופל

הבעיה הבולטת ביותר היא חוסר תאימות מוחלט לחומרה שאינה AMD, ואפילו שם יש באגים מוכרים בווינדוס שדורשים גרסאות קוד ספציפיות כדי שראש החיזוי לא יתרסק. מעבר לזה, המודל מגיע עם מנגנון חשיבה שמופעל כברירת מחדל בעוצמה מקסימלית. אם תגדירו תקציב תווים קטן, כל המילים יתבזבזו על החשיבה הפנימית והתשובה תחזור ריקה לגמרי. בנוסף, לא נמדדו מבחני קוד מתקדמים או שליפת נתונים ארוכה, כך שאין הוכחה להתנהגות שלו במשימות מורכבות.

שאלות
נפוצות

האם אפשר להריץ את הקבצים האלה על כרטיס של אנבידיה?

לא, הפורמט הזה עובד רק דרך סביבת התוכנה של AMD ובחומרה ייעודית. כרטיסי אנבידיה או הרצה על מעבד רגיל יכשלו בטעינת הטנסורים.

מדוע המודל מחזיר לפעמים תשובה ריקה לחלוטין?

ברירת המחדל של רכיב החשיבה מוגדרת למצב מקסימלי, ולכן תקציב תווים מוגבל מתבזבז כולו על תהליך המחשבה. כדי לתקן זאת צריך להגדיל את מכסת התווים או לכבות את החשיבה בהגדרות התבנית.

איך מריצים

אי אפשר להריץ את הקבצים האלה על כרטיסי אנבידיה או עם מעבד רגיל. הקבצים דורשים חומרת AMD מתאימה כמו מעבד AI Max פלוס 395 עם זיכרון אחוד, יחד עם גרסה מיוחדת של לאמה סי פי פי שתומכת בפורמט ROCmFP4. מבין הקבצים מומלץ לקחת את STRIX שנותן ביצועים זהים לקבצים האחרים אבל שומר על דיוק עדיף. הפעלת ראש החיזוי דורשת קובץ טיוטה נפרד והגדרת עומק של ארבעה שלבים, אחרת ברירת המחדל חותכת את המהירות בחצי.

אם אין לכם בדיוק את סביבת החומרה והתוכנה הזו של AMD, אין טעם להוריד את הקבצים. במקרה כזה שימוש בממשק שרת חיצוני של ספק ענן פשוט יחסוך שעות של ניסיונות התקנה שלא יעבדו.

ollama run hf.co/kingjones777/Qwen3.8-27B-ROCmFP4-STRIX-MTP-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל הבסיסי וראש החיזוי מופצים תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בהם ליישומים מסחריים, לבצע שינויים ולהפיץ אותם בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗