GPT
Q

Qwen3.8-27B-INT8-W8A16-MTP

קוד פתוח

luedapache-2.02026-08-14

  • vllm
  • safetensors
  • qwen3_5
  • qwen3.8
  • compressed-tensors

גרסת קוונטיזציה של מודל התמונה והטקסט בגודל 28 מיליארד פרמטרים. היא נבנתה במיוחד להרצה מהירה על שני כרטיסי מסך ביתיים מסדרת אמפר, בלי לאבד את רמת הדיוק של המקור.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 29.5 GBמשקל הקבצים
  • 107,756הורדות בחודש

מה זה

מדובר במודל שמשלב עיבוד תמונה וטקסט עם ארכיטקטורה היברידית של 64 שכבות, שרובן מבוססות מנגנון תשומת לב ליניארי מסוג גייטד דלתא-נט וחלקן תשומת לב מלאה. ההמרה מורידה את המשקולות לדיוק של שמונה ביטים, אבל משאירה חלקים רגישים בדיוק מלא של 16 ביטים כדי לא לפגוע באיכות. בין החלקים שנשארו בדיוק המקורי נמצאים מודול הראייה, ראש החיזוי, והרכיב שמאיץ את ייצור הטקסט.

בדיקות הסטייה מראות התאמה של 99.36 אחוזים לבחירות של המודל המקורי, שזה דיוק גבוה בהרבה מהגרסה הרשמית שנבדקה באותם תנאים. המבנה הזה מצליח לשמור על יציבות גם בבדיקות רצף של 4,000 טוקנים בלי צבירת שגיאות. לצד זה, המערכת כוללת מנגנון מובנה שמנחש שלושה טוקנים קדימה ומאפשר קצב ייצור של עד כמעט 70 טוקנים לשנייה.

מתאים ל

  • ניתוח מסמכים חזותיים ארוכים

    מנוע הראייה נשמר ברמת דיוק מלאה ומאפשר לקרוא צילומי עמודים מרובים בהקשר של מעל 200 אלף טוקנים.

  • שרת מקומי לפיתוח יחיד

    מאפשר לעבוד באופן מקומי ופרטי על זוג כרטיסים ביתיים עם קצב פלט מהיר בזכות חיזוי טוקנים מובנה.

  • עיבוד תמונות וקוד משולב

    התאמה של מעל 99 אחוז לבחירות המקור במשימות תכנות מאפשרת לחלץ נתונים ולכתוב קוד לפי צילומי מסך.

איפה זה נופל

שמירת זיכרון של חלקי משפטים עלולה לגרום לפלט שגוי בקריאות לפונקציות או בהקשרים ארוכים, אלא אם מטליאים את הקוד של מנוע ההרצה בתשע שורות ספציפיות. מעבר לזה, טיפול בשתי בקשות במקביל ומעלה גורם לקריסות אקראיות של הדרייבר בגלל באג בזיכרון, ולכן כרגע בטוח להריץ אותו רק מול משתמש יחיד. בנוסף, חלון ההקשר המורחב למיליון טוקנים שקיים במודל המקורי אינו שמיש כאן, כי מאגר הזיכרון הנוכחי מוגבל פיזית ל־266 אלף טוקנים בלבד.

שאלות
נפוצות

אפשר להריץ את המודל הזה עם תוכנת llama.cpp?

לא, הקבצים שמורים בפורמט משקולות דחוסות שמיועד לספריית vLLM. המאגר אינו כולל קובצי GGUF, ולכן לא ניתן לטעון אותו ישירות בכלים שמבוססים על הפורמט הזה.

האם אפשר להשתמש בהקשר המורחב של מיליון טוקנים?

לא על התצורה הזו. אף על פי שהמודל הבסיסי תומך בהרחבה באמצעות מנגנון יעודי, מאגר הזיכרון המשותף על שני כרטיסי המסך מספיק בפועל לכ־266 אלף טוקנים בלבד.

למה המערכת קורסת כששולחים כמה בקשות במקביל?

קיימת בעיית זיכרון מוכרת במנוע ההרצה בגרסה הנוכחית בעת שימוש בפיענוח ספקולטיבי. כדי למנוע נפילות פתאומיות, חובה להגביל את המערכת לעיבוד רצף אחד בלבד בכל רגע.

איך מריצים

בשביל להריץ אותו צריך שני כרטיסי מסך מדגם אר-טי-אקס 3090 עם 24 גיגה-בייט זיכרון בכל אחד, שמחוברים בלי צורך בגשר פיזי מהיר ביניהם. המודל תופס קצת פחות מ־15 גיגה-בייט בכל כרטיס, מה שמשאיר מקום למאגר של כ־266 אלף טוקנים בזיכרון המשותף תחת דחיסת אף-פי 8. ההרצה דורשת שימוש בספריית וי-אל-אל-אם דרך קרנל מיוחד שמחלץ את המשקולות בזמן אמת, והוא אינו מתאים לתוכנות כמו לאמה סי-פי-פי כי הוא לא מופץ כקובץ ג'י-ג'י-יו-אף.

אם אתם צריכים תעבורה גבוהה לכמה משתמשים במקביל, עדיף להשתמש בשירות ענן מנוהל. בהקשרים ארוכים במיוחד, מעל 100 אלף טוקנים, לוקח למודל מעל מאה שניות רק לפלוט את המילה הראשונה. מול בקשות ארוכות כאלה, התשתית הביתית הזו מחזיקה משתמש יחיד בלבד בכל רגע נתון.

pip install -U huggingface_hub
hf download lued/Qwen3.8-27B-INT8-W8A16-MTP

הרישיון

הקוד והמשקולות מופצים תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המודל, הפצה מחדש והטמעה בתוך מוצרים, ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בכל הפצה של הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗