GPT
Q

Qwen3.8-27B-EXL3-3.5bpw

קוד פתוח

Mia-AiLabapache-2.02026-08-24

  • exllamav3
  • safetensors
  • qwen3_5
  • exl3
  • quantization

גרסה מכווצת של מודל עמוק שמיועדת להידחס לתוך כרטיס מסך בודד של 24 גיגה. שילוב של קווינטיזציה מותאמת עומס שומר על ביצועי קוד והסקה בלי לוותר על הקשר ארוך.

  • 7.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 14.3 GBמשקל הקבצים
  • 2,083הורדות בחודש

מה זה

המימוש הזה לוקח את המודל המקורי ומכווץ אותו לדיוק ממוצע של 3.5 ביטים לפרמטר בפורמט EXL3. במקום להשתמש בטקסטים כלליים לדחיסה, התהליך כויל ישירות על עקבות שימוש של קוד ומתמטיקה בהיקף של 622,515 טוקנים מאותה משפחה. המבנה הפנימי משלב 16 שכבות תשומת לב מלאה עם 48 שכבות של gated-deltanet, מה שאומר שרק חלק קטן מהמודל דורש זיכרון מטמון כבד בזמן ריצה.

בבדיקות של הפעלת כלים המודל קיבל ציון של 87 עד 88 מתוך 100 במבחן tool-eval-bench 2.5.1 במצב קשה. הכיול הממוקד שומר על דיוק תחבירי והבנת כלים ברמה גבוהה מאוד ביחס לגודל הקובץ, והשכבות המרכזיות כמו הטוקנייזר וראש החיזוי נשארו ברמת דיוק גבוהה יותר כדי למנוע ירידה באיכות הפלט.

מתאים ל

  • ניתוח מסמכים ארוכים

    ניצול מלא של 262 אלף טוקנים על כרטיס 24 גיגה בודד ללא צורך בריבוי מעבדים גרפיים.

  • סוכן אוטונומי לקוד

    כיול ייעודי לקוד ומדידה של 87 מתוך 100 בהפעלת כלים מאפשרים הרצה מקומית של סוכני תכנות.

  • הסקה מהירה מקומית

    מנגנון חיזוי מרובה טוקנים מובנה מספק קצב יציב של כ־30 טוקנים לשנייה בלי משקולות נוספות.

איפה זה נופל

למרות שהקובץ כולל הרחבה למיליון טוקנים, מעבר ל־262 אלף טוקנים המודל מאבד אחיזה. בבדיקות שליפה בעומק של 300 אלף טוקנים, חיפושים בסוף הטקסט נכשלו לחלוטין. בנוסף, אין במודל הזה רכיב ראייה בכלל, וחלק מהתכונות המתקדמות כמו שמירת מטמון דחוסה מחייבות מזלג של הספרייה ולא עובדות ישירות על הגרסה הרשמית של exllamav3.

שאלות
נפוצות

האם המודל תומך בתמונות או מסמכים סרוקים?

לא. הקבצים מכילים אך ורק את מודל השפה והטוקנייזר, ורכיב הראייה הוסר לחלוטין בתהליך ההמרה.

האם כדאי להפעיל את ההרחבה למיליון טוקנים?

רק אם אין ברירה אחרת. הבדיקות מראות שהמודל שומר על אמינות מלאה רק עד 262,144 טוקנים, ומעבר לכך הוא מתחיל לפספס פרטים בחלק האחרון של הטקסט.

איזה כרטיס מסך נדרש כדי להריץ אותו בהקשר מלא?

כרטיס בודד של 24 גיגה מספיק לכל חלון ההקשר המקורי, בתנאי שמשתמשים במטמון NVFP4 ובראש החיזוי הפנימי שנכלל במשקל.

איך מריצים

המשקל יושב על 14.2 גיגה בלבד, ולכן הוא מתאים בדיוק לכרטיסי 24 גיגה פופולריים. אם משתמשים בזיכרון מטמון מסוג NVFP4 ובראש החיזוי המובנה של המודל, אפשר לפתוח את כל חלון ההקשר המקורי של 262 אלף טוקנים ישירות על חומרה מקומית כזו בלי לפצל זיכרון.

ההרצה מתבצעת דרך ספריית exllamav3. מי שרוצה מהירות גבוהה יותר יכול לחבר מודל טיוטה נפרד בשם DFlash2 ששוקל 1.4 גיגה ומגיע לקצב של 47.5 טוקנים לשנייה במשימות קוד, אבל הוא דורש מזלג ייעודי של הספרייה ותופס מקום שמקצר את ההקשר הזמין לכ־220 אלף טוקנים.

pip install -U huggingface_hub
hf download Mia-AiLab/Qwen3.8-27B-EXL3-3.5bpw

הרישיון

רישיון apache-2.0 מלא שעובר ישירות ממודל הבסיס. מותר להשתמש בו לצרכים מסחריים, לשלב אותו בקוד סגור ולשנות אותו, בלי תמלוגים או מגבלות הפצה מיוחדות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗