GPT
Q

bartowski/Qwen3.8-27B-GGUF

קוד פתוח

bartowskiapache-2.02026-08-14

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת למודל מולטימודלי של 28 מיליארד פרמטרים שמעבד טקסט ותמונות. הוא מביא יכולות היסק עמוקות ותמיכה בהאצה מובנית בלי לחייב אשכול כרטיסי מסך יקר.

  • 447 GBמשקל הקבצים
  • 431,438הורדות בחודש
  • 135לייקים

מה זה

המודל מבוסס על ארכיטקטורת 28B של עליבאבא ועבר המרה מקיפה לפורמט llama.cpp באמצעות כיול imatrix. הכיול בוצע מול טקסט, קריאות לכלים ושיחות הסקה, מה שמצמצם את אובדן הדיוק במעבר למספרים שלמים. בנוסף לטקסט רגיל, הוא כולל קובצי mmproj שמחברים אליו יכולת ראייה ממוחשבת לקריאת תמונות.

הייחוד הטכני כאן לעומת משקלים פתוחים אחרים בגודל הזה הוא שילוב שכבות MTP לחיזוי מרובה טוקנים. השכבות האלו משמשות כמודל טיוטה פנימי ומאפשרות הרצה ספקולטיבית מובנית בלי להוריד מודל עזר קטן נוסף. זה מאיץ את קצב הפליטה ומנצל את הזמן שבו הזיכרון ממתין לטעינת משקלים.

מבנה התשובה דורש תבנית צ'אט שמגדירה מאמץ חשיבה גבוה ומייצרת בלוק ייעודי לתהליך המחשבה לפני המענה הסופי. התוצאה היא מענה שבודק הנחות יסוד ומתאים למשימות קוד, ניתוח מסמכים או חילוץ מידע מתמונות ומערכות שיחה.

מתאים ל

  • ניתוח מסמכים מצולמים

    טעינת קובץ התמונה דרך רכיב הראייה מאפשרת חילוץ נתונים מדויק מטפסים ודיאגרמות ישירות לתשובת טקסט.

  • הרצה מקומית מאובטחת

    גרסת 4 ביט נכנסת במלואה לכרטיס מסך בודד של 24 גיגה בייט ומבטיחה שהמידע הרגיש לעולם לא יוצא מהארגון.

  • הסקה ופתרון בעיות קוד

    תבנית השיחה המובנית מכריחה את המודל לכתוב תהליך חשיבה מפורט שמונע טעויות היגיון נפוצות בקוד.

איפה זה נופל

הכרטיס מציין במפורש שגרסאות הקוונטיזציה הנמוכות, במיוחד ברמות של Q2 ו־Q3_K_S, מספקות איכות ירודה שלא מומלצת לעבודה מדויקת. שכבות ה־MTP כווצו כולן לפורמט Q4_0 ללא כיול imatrix, מה שעלול ליצור שגיאות חיזוי במצבים מסוימים. בנוסף, חובה להשתמש בגרסת llama.cpp מספר b10419 ומעלה, אחרת הארכיטקטורה לא תיטען כלל. קובצי ה־BF16 הגולמיים מפוצלים ומחייבים הורדה ידנית מורכבת יותר.

שאלות
נפוצות

איזו חומרה נדרשת כדי להריץ את גרסת ברירת המחדל במהירות סבירה?

כדי להריץ את גרסת Q4_K_M בקצב עבודה תקין צריך כרטיס מסך בעל 24 גיגה זיכרון וידאו. אם אין כרטיס כזה, אפשר לטעון אותו על זיכרון המחשב הרגיל או לבחור בגרסאות IQ3, אך קצב ייצור הטוקנים ייפול משמעותית.

איך מפעילים את היכולת לעבד תמונות לצד הטקסט?

יש לצרף את קובץ המקרן mmproj התואם להרצה ב־llama.cpp. בעבודה דרך llama-server עם מזהה המודל המלא, המערכת מושכת את קובץ התמונות אוטומטית ומאפשרת לשלוח צילומים ישירות בממשק המשתמש.

איך מריצים

קובץ ברירת המחדל המומלץ הוא Q4_K_M במשקל 17.77 גיגה בייט, שדורש כרטיס מסך בודד עם 24 גיגה זיכרון כדי לרוץ כולו בזיכרון הגרפי ולקבל ביצועים שמישים. הקבצים נעים מגרסת בסיס BF16 של 54.66 גיגה בייט ועד IQ2_XXS בנפח 9.39 גיגה בייט, כאשר ברמות הדחיסה שמתחת ל־Q4 עדיף לבחור בגרסאות ה־IQ אם אתם עובדים על חומרת אנבידיה או AMD.

מריצים אותו בפקודה אחת דרך llama-server יחד עם דגל שמפעיל את שכבות ה־MTP להאצה, וקובץ הראייה נמשך עצמאית. אם אין ברשותכם כרטיס עם מספיק זיכרון גרפי ואתם נאלצים לזלוג לזיכרון המערכת או לרדת לרמות קוונטיזציה של 2 ביט, עדיף להשתמש ב־API חיצוני של מודל ענן ולא לסבול מאיטיות חריפה ומפגיעה בדיוק.

ollama run hf.co/bartowski/Qwen3.8-27B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו כחלק ממוצר סגור ולהטמיע אותו בשרתים מקומיים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗