GPT
Q

Qwen_Qwen3.5-27B-GGUF

קוד פתוח

bartowskiapache-2.02026-02-24

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • imatrix
  • conversational

הגרסה הזו דוחסת את המודל של Qwen לקובצי GGUF שרצים מקומית על מעבד או כרטיס מסך ביתי. היא מיועדת למי שצריך מודל משולב של תמונה וטקסט בלי להסתמך על שרתי ענן.

  • 452 GBמשקל הקבצים
  • 21,452הורדות בחודש
  • 75לייקים

מה זה

מדובר במודל שפותח במקור על ידי Qwen ועבר המרה וכיול בשיטת imatrix על ידי bartowski, באמצעות גרסה b9222 של llama.cpp. המטרה המוגדרת שלו היא עיבוד תמונה וטקסט יחד ליצירת טקסט חדש, והוא מגיע עם שכבות MTP שמאפשרות שימוש בטכניקת speculative decoding להאצת הקצב.

הפורמט מציע קשת רחבה של דחיסות, החל ממשקלים מלאים ועד גרסאות מכווצות מאוד שמיועדות לחומרה חלשה יותר. הפורמטים מסוג Q4_0 ו־IQ4_NL כוללים תמיכה בסידור מחדש של משקלים בזמן אמת, מה שמשפר את הביצועים בריצה על מעבדי ARM ו־AVX בלי צורך בקבצים ייעודיים ישנים.

מתאים ל

  • הסבת מסמכים וטקסט מתמונות

    המודל מעבד קלט משולב של תמונה ומלל ומפיק תשובות טקסטואליות ישירות.

  • עבודה מקומית ללא רשת

    קבצי ה־GGUF מתאימים לריצה בתחנות מקומיות בלי לשלוח מידע החוצה.

  • הסקה מואצת באמצעות MTP

    תמיכה בדגלי llama.cpp החדשים מאפשרת קצב הפקת טוקנים מהיר בחומרה מתאימה.

איפה זה נופל

הגרסאות המכווצות ביותר משלמות מחיר כבד באיכות הפלט. הכרטיס מציין במפורש שגרסאות כמו Q3_K_S ו־Q3_K_M מפיקות איכות נמוכה, ורמות ה־IQ2 מוגדרות כאיכות נמוכה מאוד שאמנם שמישה באופן מפתיע, אך רחוקה מביצועי המקור. מעבר לזה, אם מדובר במודל חדש, הכרטיס מתריע שייתכן צורך להמתין לעדכוני תוכנה מהמפתחים של הכלים השונים כדי שהוא ירוץ תקין.

אותה משפחה

Qwen-Qwen3.5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי לי להוריד אם יש לי חומרה סטנדרטית?

ההמלצה בתיעוד היא לבחור ב־Q4_K_M ששוקל קרוב ל־18 גיגה בייט, או ב־IQ4_XS אם חסר לכם מעט מקום. אלו הגרסאות שמציעות שיווי משקל סביר בין גודל בזיכרון לאיכות התוצאה.

האם אני יכול להריץ את המודל על מעבד בלי כרטיס מסך ייעודי?

כן, אפשר להשתמש בגרסאות כמו Q4_0 או IQ4_NL שמנצלות פקודות AVX ו־ARM עם סידור זיכרון אוטומטי. קחו בחשבון שגרסאות דחוסות מאוד מסוג IQ על מעבד יעבדו לאט יותר מאשר גרסאות K מקבילות.

איך מריצים

כדי להריץ אותו צריך תוכנות תומכות כמו llama.cpp, LM Studio, ramalama או koboldcpp, ולכוון לתבנית הפרומפט הספציפית של Qwen עם תגיות המערכת והמשתמש. משקל הקבצים מתחיל ב־9.61 גיגה בייט בגרסת IQ2_XXS ומגיע עד 54.66 גיגה בייט בקובץ המלא, כשברירת המחדל המאוזנת לרוב האנשים היא Q4_K_M שדורשת כ־18 גיגה בייט של זיכרון.

אם יש לכם כרטיס מסך עם 24 גיגה בייט VRAM, גרסאות ה־Q4 עד Q5 ייכנסו במלואן וירוצו מהר. אם אין לכם חומרה כזו או שאתם בונים על מעבד בלבד עם מעט זיכרון, דחיסות ה־IQ הנמוכות יעבדו אבל הקצב עלול לזחול, ושם כבר עדיף לפנות ל־API חיצוני.

ollama run hf.co/bartowski/Qwen_Qwen3.5-27B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗