GPT
Q

Qwen3.6-27B-PRISM-PRO-DQ

קוד פתוח

Ex0bitapache-2.02026-05-19

  • gguf
  • quantized
  • dynamic-quant
  • qwen3
  • llama.cpp

גרסת קוונטיזציה מכווצת למודל 27B שעבר ניקוי מהטיות. הוא כולל מנגנון פענוח ספקולטיבי מובנה שמאיץ את הפלט בלי לפגוע באיכות.

  • 12.8 GBמשקל הקבצים
  • 3,708הורדות בחודש
  • 60לייקים

מה זה

מדובר בעיבוד של Qwen 3.6 בגודל 27 מיליארד פרמטרים, שעבר תהליך להסרת הטיות ותעמולה וכווץ לפורמט GGUF במשקל של כמעט 14 גיגה במקום 55 גיגה במקור. הארכיטקטורה משלבת 48 שכבות של קשב ליניארי לצד 16 שכבות קשב מלא, ומכילה גם את רכיבי הראייה המקוריים.

הייחוד כאן הוא שימור ראש הניחוש המובנה לפענוח ספקולטיבי. במקום להסתפק בקצב הרגיל, הפעלת המנגנון המובנה מעלה את המהירות בשרת llama.cpp מ־80 טוקנים לשנייה ל־121 טוקנים לשנייה על מעבד גרפי Blackwell יחיד, בלי לשנות את התוכן של הפלט.

מתאים ל

  • שרת מקומי מהיר

    מערכות שדורשות מענה מהיר של מעל 120 טוקנים לשנייה על חומרה בודדת באמצעות הראש המובנה.

  • עיבוד טקסט ללא הטיות

    סיכום וניתוח של חומרים רגישים שבהם רוצים לצמצם השפעה של עמדות מוטמעות ממודל המקור.

  • ניתוח משולב ראייה וטקסט

    משימות מולטימודל מקומיות שבהן צריך גם מודל שפה וגם את רכיב הראייה שנשמר במלואו.

איפה זה נופל

המודל מתמקד בהסרת הטיות ותעמולה, מה שעלול לייצר תגובות מסורסות או פגיעה בתשובות שנוגעות בנושאים פוליטיים והיסטוריים רגישים. בנוסף, מימוש הפענוח המתקדם מול מודל עזר חיצוני עדיין דורש התקנת טלאים בפיתוח עבור llama.cpp, כך שאי אפשר להסתמך עליו ישר מהקופסה בלי בדיקה של יציבות ההרצה.

שאלות
נפוצות

האם הפענוח המהיר פוגע באיכות התשובות?

לא, הפענוח הספקולטיבי בגרסה הזו מוגדר כזהה לחלוטין לפלט רגיל. ההבדל היחיד עשוי לנבוע מאי דיוקים זעירים בחישובי נקודה צפה באימות קבוצתי, אבל הטוקנים הנבחרים נשארים אותם טוקנים.

כמה זיכרון כרטיס מסך נחוץ כדי להריץ אותו?

המשקל הכולל של הקבצים עומד על כ־13.7 גיגה בייט. כרטיס עם 16 גיגה של VRAM יספיק להרצה בסיסית, אבל לשימוש בחלון הקשר ארוך עדיף כרטיס של 24 גיגה כדי למנוע חריגה מהזיכרון.

איך מריצים

מריצים אותו ישירות מול llama-server עם קובץ ה־GGUF, וכדי לקבל את מלוא הביצועים מפעילים את הדגל draft-mtp. הקבצים שוקלים קרוב ל־13 גיגה בייט, כך שכרטיס מסך מודרני עם 16 או 24 גיגה זיכרון יחזיק את המודל כולו בזיכרון המקומי בלי גלישה ל־RAM.

אם אתם לא רוצים להתעסק בקינפוג של פענוח ספקולטיבי או שאין לכם כרטיס מתאים, שירותי ענן עם מודל מקור ב־BF16 יתנו מענה פשוט יותר. בנוסף, קיימת אפשרות לחבר מודל עזר חיצוני מסוג EAGLE-3 שדורש טלאים ידניים לקוד של llama.cpp, מה שהופך את ההרצה המקומית למורכבת יותר.

ollama run hf.co/Ex0bit/Qwen3.6-27B-PRISM-PRO-DQ:Qwen3.6-27B-PRISM-PRO-DQ

הקבצים

3 קבצים במאגר, 12.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗