GPT
Q

Qwen3.6-27B-GPTQ-Pro-4bit

קוד פתוח

groxaxoapache-2.02026-04-22

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • text-generation-inference

גרסת 4 ביט מכווצת למודל מולטימודלי של 27 מיליארד פרמטרים. היא נועדה לתת יכולות ראייה, קוד והסקה חזקות על חומרת צרכנים בלי לפוצץ את הזיכרון.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.4 GBמשקל הקבצים
  • 310,225הורדות בחודש

מה זה

מדובר במודל שמשלב קלט של תמונה וטקסט ומחזיר טקסט, המבוסס על סדרת Qwen3.6 ומכווץ בשיטת GPTQ-Pro עם מדד FOEM. הכיווץ הזה תוכנן במיוחד לעבודה מול קרנלים של Marlin במנועי שרת כמו vLLM, כדי לסחוט קצב יצירת טוקנים גבוה בלי לאבד את כושר הניתוח של מודל בגודל מלא.

מבחינת מדדי איכות, המפתח מדווח על תוצאת Perplexity של 6.366 במבחן Wikitext-2 עם אורך הקשר של 1024 טוקנים. המספר הזה מעיד על שימור יציב של השפה לאחר הדחיסה, כך שההסקה והתחביר נשארים צמודים למקור למרות הירידה החדה בנפח המשקלים על כרטיס המסך.

מתאים ל

  • ניתוח מסמכים ותמונות

    הוא תומך בקלט משולב של תמונה וטקסט ומאפשר חילוץ מידע ויזואלי מורכב ישירות לתוך קוד.

  • שרת שאלות ותשובות מקומי

    רץ בקצב של 64 טוקנים לשנייה על שני כרטיסי צרכנים עם תמיכה רחבה בהפעלת כלים וקריאות פונקציה.

  • בדיקת משימות תכנות

    מיועד להסקת מסקנות וקוד בעזרת מפענח ייעודי למבנה התשובות שמובנה בחבילת הריצה.

איפה זה נופל

הבעיה המרכזית היא זיכרון ה־KV Cache. למרות שהארכיטקטורה מוגדרת רשמית עם חלון של 262,144 טוקנים, ניסיון לפתוח את כל החלון על שני כרטיסי RTX 3090 מוביל מיד לשגיאת זיכרון מלא בהקצאה. בפועל, המפרסם הצליח לייצב את הריצה רק כשהגביל את האורך ל־65,536 טוקנים עם מצב eager.

בנוסף, פענוח ספקולטיבי מסוג MTP לא הניב שום שיפור בביצועים ובדיקות הראו אפס טוקנים שהתקבלו דרכו. המודל גם מוגדר רשמית עבור השפה האנגלית בלבד, כך שצריך לבדוק היטב את הפלט שלו אם אתם מתכננים להזין לו הנחיות בעברית.

שאלות
נפוצות

האם אפשר להשתמש בכל חלון ההקשר של 260 אלף טוקנים על חומרה ביתית?

לא. בדיקות מראות שעל שני כרטיסי 24GB המערכת קורסת מחוסר זיכרון בעת הקצאת הזיכרון להקשר המלא. כדי להריץ באופן יציב צריך להגביל את האורך לכ־65 אלף טוקנים.

איך הכי מומלץ להרים אותו בסביבת שרת?

הדרך הנקייה היא דרך vLLM עם הדגלים float16 וקוונטיזציה של gptq_marlin. תצטרכו להגדיר חלוקה לשני כרטיסים ולבטל מנגנוני speculative decoding שלא עובדים כאן כרגע.

איך מריצים

כדי להריץ אותו כמו שצריך תצטרכו שני כרטיסי מסך כמו RTX 3090, בתצורת tensor parallel שווה ל־2, תוך שימוש במנוע vLLM עם gptq_marlin ודיוק float16. המפתח בדק את ההגדרה הזו וקיבל מהירות ממוצעת של 64 טוקנים לשנייה וזמן לתגובה ראשונה של סביב 54 מילישניות.

אם יש לכם כרטיס בודד חלש יותר, חבל על הזמן. פתיחת חלון הקשר ענק תגרום לקריסת זיכרון מידית, ולכן במקרים של עומס נקודתי או חומרה מוגבלת עדיף להשתמש ב־API מרוחק במקום להסתבך עם הגדרות מקומיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="groxaxo/Qwen3.6-27B-GPTQ-Pro-4bit")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗