GPT
Q

Qwen3.6-27B-MTP-UD-GGUF

קוד פתוח

havenoammoapache-2.02026-05-06

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5

גרסת GGUF שעברה כיול דינמי והושתלו בה שכבות חיזוי רב טוקני. היא מיועדת למי שרוצה מהירות דגימה גבוהה במיוחד על חומרה מקומית תואמת בלי לאבד דיוק.

  • 119 GBמשקל הקבצים
  • 703הורדות בחודש
  • 106לייקים

מה זה

הפרויקט הזה לוקח את הדגם הבסיסי בגודל 27 מיליארד פרמטרים, מכייל אותו בשיטת Unsloth Dynamic 2.0 XL, ומשלב לתוכו ראשי חיזוי רב טוקני שנלקחו מגרסת שמונה ביט נפרדת. המטרה של המהלך היא לאפשר פענוח ספקולטיבי ישירות מתוך קובץ הדגם, כך שצווארי הבקבוק המוכרים של קריאת משקלים מואצים בלי צורך להריץ מודל טיוטה חיצוני קטן יותר.

הבסיס כולל ארכיטקטורה היברידית של שכבות תשומת לב לצד שכבות דלתא נט ליניאריות, עם תמיכה מובנית בעיבוד תמונה וטקסט. הדגם כולל מנגנון שמאפשר לשמור את שלבי החשיבה המוקדמים לאורך היסטוריית השיחה, מה שמסייע לשמור על הקשר עבודה רציף ולמנוע חישוב חוזר של שרשראות הסקה מורכבות במשימות תכנות וסוכנים.

מתאים ל

  • פיתוח סוכני קוד מקומיים

    ניתוח מאגרי קוד ופתרון תקלות תוך שמירה על רצף החשיבה הקודם בלי להעמיס מחדש.

  • מערכות מענה חזותי מהיר

    שילוב קלט תמונה עם טקסט שדורש מהירות תגובה גבוהה מקומית בעזרת חיזוי רב טוקני.

  • הפעלת שרת הסקה פנימי

    שירות פנים ארגוני לעיבוד מסמכים ארוכים ללא שליחת מידע רגיש החוצה.

איפה זה נופל

המודל פועל במצב חשיבה כברירת מחדל ואינו תומך במעבר הרך של פקודות ביטול חשיבה ישנות, כך שנדרש שינוי פרמטרים ידני בתבנית הצ'אט כדי לכבות זאת. חלון ההקשר המלא של 262,144 טוקנים עלול לגרום בקלות לחריגות זיכרון חמורות אם לא מגבילים אותו, ובנוסף, יכולת החיזוי המהירה תלויה לחלוטין בקוד שטרם נכנס לענף הרשמי המרכזי של מנוע ההרצה.

שאלות
נפוצות

למה צריך גרסה מותאמת אישית של מנוע ההרצה?

הקבצים כוללים שכבות חיזוי ספקולטיבי מושתלות שלא נתמכות במלואן בגרסאות הישנות. כדי להפיק מהן תועלת ולא להריץ אותו כדגם רגיל ואטי יותר, נדרש קוד ספציפי שממזג את השינויים מבקשת המשיכה.

האם המודל תומך בעבודה עם תמונות?

כן, הארכיטקטורה כוללת מקודד חזותי ייעודי. ניתן להזין תמונות יחד עם שאילתות טקסט, אם כי עומס הזיכרון עולה בהתאם כאשר מנתחים קבצים מרובים במקביל.

איך מריצים

כדי להריץ אותו עם יכולות החיזוי הפעילות לא מספיק להשתמש בבילד רגיל של llama.cpp. נדרש הידור עצמאי שכולל את שינויי הקוד מתוך בקשת המשיכה 22673, או שימוש באחד מאימג'י הדוקר המוכנים שהועלו עבור סביבות כמו קודה, וולקן, אינטל או רוקם. בריצה עצמה חייבים להגדיר שימוש במנגנון מתאים והגבלה לשלושה טוקנים מנוחשים בכל צעד.

המשקל הכולל של הקבצים במאגר מגיע ל־119 גיגה בייט ומחולק לעשרה חלקים, כך שצריך כרטיסי מסך חזקים מאוד או שילוב זיכרון משמעותי כדי לטעון אותו ולשמור מקום למטמון. אם אין לכם חומרה כבדה ייעודית, עדיף בהרבה לפנות לשירותי ענן או מנועי שרת כמו vLLM ו־SGLang שמציעים גישה ישירה דרך ממשק תואם.

ollama run hf.co/havenoammo/Qwen3.6-27B-MTP-UD-GGUF:Q6_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. הוא מתיר שימוש מסחרי חופשי, שינוי של הקבצים והפצה מחודשת, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים לכל תוצר שאתם משחררים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗