GPT
Q

Qwen_Qwen3.5-35B-A3B-GGUF

קוד פתוח

bartowskiapache-2.02026-02-24

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת למודל ראייה וטקסט של עליבאבא, שנועדה לאפשר הרצה מקומית של יכולות מולטימודליות על חומרה צרכנית בלי לשלם על שירותי ענן.

  • 564 GBמשקל הקבצים
  • 429,982הורדות בחודש
  • 68לייקים

מה זה

מדובר בהמרה של המודל המקורי מקבוצת Qwen שביצע bartowski באמצעות כלי llama.cpp וטכניקת כיול מבוססת imatrix. המודל מוגדר למשימות של תמונה וטקסט ומחזיר טקסט, כשהפורמט המובנה שלו כולל תמיכה בחשיבה עם תגית ייעודית של think לצד הנחיות מערכת.

הייחוד בגרסאות האלו הוא הטווח הרחב של הכיווצים, שמתחיל מקובץ מקורי מלא בגודל 71.07GB בפורמט bf16 ויורד עד כיווצים קיצוניים כמו IQ1_M של 9.42GB. בחלק מגרסאות הביניים, למשל Q4_K_L או Q3_K_XL, הממיר שמר על משקולות הקלט והפלט ברמת Q8_0 כדי לצמצם אובדן איכות בדיוק בנקודות הרגישות של המודל.

מתאים ל

  • ניתוח מסמכים ותמונות אופליין

    מאפשר פענוח תמונות והפקת תובנות מקומית בלי לחשוף מידע פנימי לרשת, בעזרת גרסאות Q4 ומעלה.

  • שרת שפה עצמאי בתקציב נמוך

    ריצה מלאה בזיכרון של כרטיס מסך יחיד של 24GB באמצעות גרסת Q4_K_M תוך ניצול שכבות האצת MTP.

  • פיתוח אפליקציות שולחניות

    שילוב המודל בתוכנות קצה מקומיות בעזרת llama.cpp או LM Studio, ללא תלות בתשלום פר טוקן לחברות ענן.

איפה זה נופל

הכיווצים הנמוכים ביותר סובלים מנפילה מורגשת באיכות. יוצר ההמרה מציין בפירוש שגרסת IQ1_M לא מומלצת לשימוש, ושגרסאות ה־Q2 או Q3_K_S מספקות איכות נמוכה מאוד, כך שלא כדאי לבנות עליהן למשימות שדורשות דיוק גבוה או חילוץ פרטים קטנים מתמונות.

בנוסף, אם אתם רצים על מעבדי CPU בלבד, כיווצי ה־IQ החדשים יהיו איטיים יותר בהשוואה לכיווצי K המקבילים. צריך גם לזכור שמודלים חדשים עשויים לדרוש גרסה מעודכנת של כלי ההרצה כדי לפענח את הארכיטקטורה בלי שגיאות.

אותה משפחה

Qwen-Qwen3.5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך הרשימה?

הכלל הוא לבחור קובץ שקטן בגיגהבייט או שניים מסך הזיכרון הגרפי הזמין שלכם. לרוב מי שמחזיק כרטיס של 24GB, גרסת Q4_K_M שלוקחת 22.29GB תיתן את האיזון הטוב ביותר בין מהירות לאיכות. אם הזיכרון מוגבל יותר, אפשר לבדוק את IQ4_XS.

האם המודל תומך בהרצה על מחשבי מק עם שבבי אפל?

כן, llama.cpp וכלים מבוססים עליה תומכים בחומרה הזו ישירות. הכרטיס מציין שגרסת Q4_1 אמנם מוגדרת כמבנה ישן יותר, אבל מספקת יעילות משופרת של טוקנים ביחס להספק החשמלי על מעבדי אפל סיליקון.

מה המשמעות של שכבות ה־MTP שנוספו כאן?

מדובר באפשרות לחזות כמה טוקנים במקביל במקום אחד בכל פעם, מה שמקצר את זמן הפקת התשובה. llama.cpp תומכת בזה החל מגרסה b9180 ומפעילים את זה בריצה עם הדגל spec-type draft-mtp.

איך מריצים

אתם מורידים קובץ בודד שמתאים לזיכרון שלכם, ולא את כל המאגר. אם יש לכם כרטיס מסך עם 24GB של VRAM, גרסת Q4_K_M שלוקחת 22.29GB היא ברירת המחדל המומלצת כדי להריץ את הכל ישירות על המעבד הגרפי. במחשבים עם פחות זיכרון גרפי תצטרכו לרדת לכיווצי I-quants או לפצל את הריצה בין כרטיס המסך לזיכרון הראשי, מה שיוריד משמעותית את מהירות הפלט.

ההרצה עובדת דרך כלים כמו llama.cpp, LM Studio או Jan AI. המודל תומך בריצת שכבות MTP החל מגרסה b9180 של llama.cpp באמצעות הדגל הייעודי שמאיץ יצירת טקסט, ובמעבדי ARM ו־AVX אפשר לנצל גרסאות כמו Q4_0 שמבצעות סידור משקולות אוטומטי בזמן טעינה לשיפור מהירות.

ollama run hf.co/bartowski/Qwen_Qwen3.5-35B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

61 קבצים במאגר, 564 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והמשקולות והפצה שלהם בתוך מוצרים, כולל קוד סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗