GPT
Q

byteshape/Qwen3.5-9B-GGUF

קוד פתוח

byteshapeapache-2.02026-03-31

  • transformers
  • gguf
  • qwen3.5
  • byteshape
  • image-text-to-text

גרסת GGUF מכווצת של מודל ויז'ואל ושפה עם 9 מיליארד פרמטרים. היא נבנתה במיוחד כדי לרוץ מקומית על כרטיסי מסך או מעבדים חלשים בלי לאבד חדות.

  • 51.0 GBמשקל הקבצים
  • 2,038הורדות בחודש
  • 37לייקים

מה זה

מדובר בעיבוד של המודל Qwen3.5-9B לפורמט GGUF, שמטפל גם בטקסט וגם בתמונות. המפתחים השתמשו בשיטה בשם ShapeLearn, שלומדת סוג נתונים נפרד לכל טנזור ומטרתה להפיק דיוק גבוה גם כשדוחסים את המשקלים לרמות של פחות משלושה ביטים.

הייחוד כאן הוא החלוקה המכוונת לפי חומרת היעד. במקום קובץ אחד כללי, הם בנו גרסאות שמיועדות לכרטיסי מסך עם שילוב של כימותי KQ ו־IQ לדחיפת קצב טוקנים גבוה יותר, לצד גרסאות נפרדות למעבדי מחשב רגילים. הבדיקות שהם ערכו הקיפו מבחני קוד, פונקציות ומתמטיקה כמו LiveCodeBench ו־BFCL-V3 מול שיטות מקבילות, במטרה לשמור על ביצועים יציבים בגדלי קובץ שנעים סביב שלושה עד שישה גיגה-בייט בלבד.

מתאים ל

  • ניתוח תמונות במחשב מקומי

    קריאת מסמכים ותמונות בלי חיבור לרשת ובלי לשלוח דאטה לשרתים חיצוניים, על חומרה צנועה.

  • חילוץ פונקציות וקוד

    הרצת משימות אוטומציה ובדיקת קוד מקומית תוך שמירה על ביצועים גבוהים במבחני BFCL ו־HumanEval.

  • מערכות קצה מבוססות CPU

    הפעלת מודל רב-מודאלי על חומרת מעבד בלבד או לוחות כמו Raspberry Pi 5 כשאין כרטיס מסך ייעודי.

איפה זה נופל

Ollama לא תומך בגרסאות האלה כרגע, מה שפוסל מיד שימוש בהרבה סביבות פיתוח מקומיות קיימות. שמות הכימותים כמו IQ4_XS לא תואמים להגדרות הרגילות של llama.cpp, מה שמקשה להבין בדיוק אילו שכבות נדחסו ואיך, ומחייב אתכם לבדוק את איכות הפלט בכל גרסה ידנית. מעבר לכך, בעבודה מול משימות ויז'ואל מורכבות במיוחד, גרסאות ה־3 ביטים הנמוכות עלולות לפגוע בהבנת פרטים קטנים בתמונה בהשוואה למודל המקורי.

שאלות
נפוצות

אפשר לטעון את המודל לתוך Ollama?

לא. לפי עמוד הפרויקט, Ollama אינו תומך כרגע בגרסאות ה־GGUF של מודל זה, והפתרון הוא לעבוד דרך llama.cpp או LM Studio.

למה יש שתי טבלאות נפרדות למעבד ולכרטיס מסך?

הכימות בכל קובץ הותאם פיזית לחומרה, גרסאות ה־GPU משלבות שיטות KQ ו־IQ כדי להעלות את קצב הטוקנים לשנייה, בעוד גרסאות ה־CPU מתמקדות באלגוריתם שרץ יעיל על מעבדים רגילים.

האם צריך להוריד קובץ נפרד עבור יכולות התמונה?

לא באופן ידני. הרצת שרת llama.cpp עם דגל mmproj-auto מושכת את מקרן הראייה הנלווה בצורה אוטומטית בעלייה הראשונה של המודל.

איך מריצים

מריצים את הקבצים ישירות בשרת של llama.cpp או בתוך LM Studio עם הדגל שמוריד אוטומטית את מקרן התמונה. קובץ בודד שוקל בין 3.15 גיגה-בייט בגרסת 2.81 ביט ועד 5.72 גיגה-בייט בגרסת 5.1 ביט, כך שכרטיס מסך פשוט עם 6 עד 8 גיגה זיכרון מחזיק אותו במלואו.

גרסאות ה־GPU מתועדפות למהירות עיבוד גבוהה יותר בכרטיסים תומכים, בעוד גרסאות ה־CPU מתאימות למחשבים ללא כרטיס ייעודי ואפילו ל־Raspberry Pi 5. אם התשתית שלכם מבוססת רק על Ollama, אי אפשר להריץ את הקבצים האלה כרגע ועדיף להישאר עם שירות מנוהל.

ollama run hf.co/byteshape/Qwen3.5-9B-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה פנימית או חיצונית בתוך מוצר, בלי חובת תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗