GPT
D

Dirk-Qwen3.8-27B-GGUF

קוד פתוח

peculiar-ragdollapache-2.02026-08-14

  • gguf
  • llama.cpp
  • qwen3_5
  • qwen3.8
  • mtp

גרסת GGUF מכוילת לראייה וטקסט של Qwen3.8-27B עם תבנית שיחה תמציתית שמקצרת פלט מיותר. מתאימה למי שרוצה ביצועים חזקים על כרטיס בודד בלי לחכות לחשיבה ארוכה.

  • 223 GBמשקל הקבצים
  • 109,133הורדות בחודש
  • 168לייקים

מה זה

המשקלים כאן שייכים לדגם הבסיס Qwen3.8-27B, דגם רב מודלי שתומך בראייה ובטקסט באנגלית ובסינית, אבל המפרסמים החליפו את תבנית השיחה בגרסת Sharp. דגם הבסיס הרגיל כופה רמת חשיבה מקסימלית בכל פנייה, מה שמנפח זמני ריצה. כאן התבנית מאופסת לרמת חשיבה בינונית ומכוונת לתשובות קצרות וישירות, בלי לגעת במשקלים עצמם.

התוצאה בפועל היא פחות מלל מיותר באותה רמת דיוק. במבחני SWE-bench-Live הוא מגיע לפתרון ב־37% מזמן החציון של התבנית הרגילה ופותר 15 משימות מתוך 25. בבדיקות MMLU-Pro הוא רושם 85.3% דיוק. הקבצים שומרים גם על ראש MTP לחיזוי מרובה תווים שמאיץ פענוח בסביבות הרצה תומכות.

הכימותים מפוצלים לשתי שיטות. בגרסאות הנמוכות של 2 עד 3 ביט משתמשים בכימות GSQ-RCO ששומר על איכות טובה יותר בתקציב זיכרון קטן, ומעל 3 ביט עוברים לכימות Dynamic 3.0 של Unsloth.

מתאים ל

  • פתרון באגים מורכבים בקוד

    מגיע לפתרונות מהר יותר מתבנית הבסיס בזכות קיצוץ תווים מיותרים, עם 15 פתרונות מתוך 25 במבחן SWE-bench.

  • ניתוח מסמכים ותמונות מקומי

    שומר על יכולות הראייה של דגם הבסיס ומריץ בדיקות קלט משולב בעזרת קובץ mmproj בודד.

  • עבודה על כרטיס 16 גיגה בייט

    גרסאות הכימות הדחוסות שומרות על רמת דיוק שקרובה למקור ונכנסות לזיכרון של כרטיס בודד יחד עם הקשר עבודה אמיתי.

איפה זה נופל

המודל הזה לא מיועד לסבבי שיחה ארוכים במיוחד של עשרות תורות תחת תקרת ההקשר, ושם דגמים ייעודיים אחרים יחזיקו טוב יותר. הוא גם איטי יותר מדגמי תערובת מומחים קטנים, שלוקחים פחות זמן במשימות קידוד שגרתיות וקלות.

הכימותים הנמוכים ביותר ברמת 2 ביט נשענים על מדידות של מעבדות אחרות ולא נבדקו מחדש כאן. בנוסף, אם לא מעבירים פרמטרים ייעודיים בתוך chat_template_kwargs כדי לשנות את מאמץ החשיבה, סביבות כמו llama.cpp מתעלמות מהשדה הרגיל ברמה העליונה.

שאלות
נפוצות

איזו גרסה להוריד אם יש לי כרטיס מסך של 24 גיגה בייט?

עדיף לבחור ב־UD-Q5_K_XL ששוקל 20.9 גיגה בייט, או ב־UD-Q4_K_XL ששוקל 17.6 גיגה בייט. שניהם משאירים מספיק זיכרון לחלון הקשר סביר בלי לפגוע באיכות הריצה.

איך משנים את עומק החשיבה של המודל אם רוצים תשובה מפורטת יותר?

המודל מוגדר כברירת מחדל לרמת medium. כדי להעלות ל־xhigh צריך להעביר את הערך בתוך chat_template_kwargs בבקשה, כי llama.cpp מתעלמת מהשדה אם שמים אותו ישירות בגוף הפנייה.

האם המודל מתאים לשיחות תמיכה ארוכות מאוד?

לא מומלץ למטרה הזו. המבנה שלו מכוון לתשובות חדות ומשימות ממוקדות, ובשיחות של מאה תורות תחת מגבלת הקשר קיימים דגמים אחרים שיחזיקו מעמד טוב יותר.

איך מריצים

ההרצה נעשית דרך llama.cpp, כשהתבנית מובנית במטא דאטה ולא דורשת הגדרות מיוחדות. למי שמשתמש בסוכן תוכנה מומלץ לוודא שמוגדר deepseek כדי שקטעי החשיבה יחזרו בשדה ייעודי ולא יתערבבו בטקסט התשובה. כל הקבצים משתמשים בקובץ mmproj-F16.gguf אחד לעיבוד תמונה, שנטען אוטומטית אם מציינים תגית כימות.

מבחינת חומרה, כרטיס של 12 גיגה בייט ידרוש את גרסאות GSQ-RCO כמו IQ2_S במשקל 9.6 גיגה בייט כדי להשאיר מקום להקשר. לכרטיס של 16 גיגה בייט הכימות המומלץ הוא IQ4_XS במשקל 14.3 גיגה בייט. לכרטיסי 24 גיגה בייט מומלץ להתחיל מ־Q4_K_XL ב־17.6 גיגה בייט או Q5_K_XL ב־20.9 גיגה בייט. למי שאין כרטיס מסך עם לפחות 12 עד 16 גיגה בייט זיכרון פנוי, עדיף להשתמש ב־API חיצוני.

ollama run hf.co/peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי קוד והפצה פנימית או חיצונית בתוך מוצר. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה. אין חובה לחשוף קוד מקור סגור שנבנה סביבו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗