GPT
Q

Qwen_Qwen3.5-9B-GGUF

קוד פתוח

bartowskiapache-2.02026-02-27

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת של המודל בתשעה מיליארד פרמטרים שמשלבת טקסט ותמונה. היא מיועדת למי שרוצה להריץ לוקאלית מודל מולטימודלי קומפקטי בלי לפשוט רגל על זיכרון גרפי.

  • 152 GBמשקל הקבצים
  • 70,340הורדות בחודש
  • 100לייקים

מה זה

המאגר מכיל המרות שונות בפורמט GGUF למודל הבסיס של Qwen, שכולל שכבות MTP חדשות הנתמכות בגרסאות העדכניות של llama.cpp. המודל מיועד לעיבוד משולב של תמונה וטקסט, ומגיע בשלל רמות כיול וכימוס שמבוססות על imatrix כדי למזער פגיעה ביכולות המקוריות.

מי שמשחרר את הקבצים כאן הוא הממיר bartowski ולא המפתחים המקוריים, כך שהדגש הוא על נגישות חומרתית. במקום להחזיק משקל מלא בזיכרון, אפשר לבחור מדרגות דיוק שונות שנעות בין איכות כמעט זהה למקור לבין קבצים רזים שמתפשרים על ביצועים לטובת חיסכון במקום.

מתאים ל

  • ניתוח מסמכים ותמונות

    זיהוי ועיבוד תוכן מתוך קובצי תמונה יחד עם הנחיות טקסט ישירות על מחשב מקומי.

  • הרצה מקומית על כרטיסי 8GB

    גרסאות ה־Q4 מאפשרות תגובה מהירה בלי לחרוג ממגבלות הזיכרון של כרטיסים ביתיים.

  • פיתוח שרתים פרטיים

    רישיון אפאצ'י מאפשר שילוב ישיר של קובצי המודל בתוך שירותים ללא תלות ברשת חיצונית.

איפה זה נופל

ההמרות הקיצוניות בדחיסה נמוכה, כמו אלו מתחת ל־Q3, מאבדות איכות בצורה מורגשת ומוגדרות מראש כבעלות ביצועים ירודים. מעבר לכך, התמיכה בשכבות MTP ובמודלים חדשים מסוג זה דורשת גרסאות תוכנה עדכניות מאוד של כלי ההרצה, ואם התוכנה שלכם אינה מעודכנת המודל פשוט לא יעבוד.

אותה משפחה

Qwen-Qwen3.5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ בדיוק כדאי להוריד מתוך הרשימה?

לרוב המשתמשים מומלץ לקחת את Q4_K_M שמאזן בין גודל של כ־6.17GB לבין איכות טובה. אם יש לכם כרטיס מסך מרווח עם 12GB זיכרון או יותר, גרסת Q6_K תספק תוצאות מדויקות יותר במחיר של כ־8GB נפח.

מה נותן הדגל draft-mtp שמוזכר בהסברים?

הוא מפעיל תמיכה בשכבות MTP שנוספו בעדכונים האחרונים של llama.cpp ומאפשרות האצה בייצור הטקסט. כדי להשתמש בזה, חובה לעבוד עם גרסת מנוע תואמת ולא גרסה ישנה.

איך מריצים

כדי להריץ אותו כמו שצריך, עדיף לטעון את כל המשקל לזיכרון כרטיס המסך. לגרסת ברירת המחדל Q4_K_M ששוקלת 6.17GB, כרטיס עם 8GB זיכרון מספיק בהחלט, בעוד שגרסאות הדיוק המלא כמו BF16 מגיעות ל־18.41GB וידרשו כרטיס מקצועי של 24GB לפחות.

אם אין לכם מעבד גרפי ייעודי ואתם מריצים על מעבד רגיל, גרסאות כמו Q4_0 מספקות אריזה מחדש ברקע להאצת הביצועים. כשצריך מהירות עיבוד מקסימלית בלי להתעסק בתחזוקת שרתים מקומית ובחירת קבצים, API מסחרי יהיה פשוט יותר מניהול הקבצים האלה לבד.

ollama run hf.co/bartowski/Qwen_Qwen3.5-9B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או מוצרית. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗