GPT
Q

Jackrong/Qwopus3.6-27B-Fusion-GGUF

קוד פתוח

Jackrongother2026-07-29

  • gguf
  • merge
  • task-vector
  • dare-ties
  • layer-weighted

שילוב בין מודל חשיבה למודל קוד שמיועד לפעול כסוכן עצמאי שלם. הוא מתאים למי שרוצה להריץ מודל מקומי שיודע לכתוב תוכנה, לזהות באגים ולתקן אותם לבד.

  • 67.3 GBמשקל הקבצים
  • 1,256הורדות בחודש
  • 47לייקים

מה זה

המודל מחבר שני כיוונונים שונים של Qwen3.6-27B, אחד שהתמחה בחשיבה שלב אחר שלב ואחד שהתמחה בכתיבת קוד. בדרך כלל שילובים כאלה פוגעים ביציבות ומכניסים את המודל ללולאות אינסופיות, אך כאן השתמשו בהזרקה מדורגת לפי עומק השכבות כדי לשמור על יכולת החשיבה בשכבות המוקדמות ולהוסיף את יכולות הקוד במאוחרות.

במבחנים התוצאות מראות 94.5% ב־HumanEval ו־82.8% ב־IFEval. מעבר למספרים היבשים, המבחן המשמעותי הוא היציבות. המודל שומר על סיום תקין של פלט גם בטמפרטורה נמוכה של 0.2 וגם בגבוהה של 0.9, מה שמאפשר לו לתפקד בתוך לולאות עבודה שדורשות חשיבה ארוכה מבלי להיתקע.

מתאים ל

  • סוכן פיתוח עצמאי

    הרצה בתוך לולאת קוד מקומית שבונה יישומים, מקבלת שגיאות משרת בדיקות ומתקנת את עצמה לבד.

  • חשיבה על קוד מקומי

    ניתוח בעיות תכנות מורכבות שדורשות שלבי הסקה מרובים ישירות על כרטיס מסך בודד של 24GB.

  • שרת תואם OpenAI

    חיבור כלי עבודה חיצוניים כמו Claude Code דרך פרוקסי ישירות למופע של llama-server.

איפה זה נופל

המודל מוגדר כגרסת מחקר ולא עבר יישור בטיחות מלא או תהליכי RLHF קפדניים. במשימות תכנות מורכבות במיוחד הוא נוטה לעיתים לחשוב יותר מדי, להתפזר ולהגיע למגבלת הטוקנים מבלי להחזיר תשובה סופית. במדגם של SWE-bench astropy הוא פתר 7 מתוך 15 משימות, הבדל קטן שנמצא בתוך טווח הרעש הסטטיסטי, כך שלא מדובר בקפיצה דרמטית אלא בשיפור הדרגתי. בנוסף, כל המדידות בוצעו רק על אנגלית.

שאלות
נפוצות

איזה כרטיס מסך צריך בשביל להריץ אותו כמו שצריך?

צריך כרטיס מסך עם לפחות 24 עד 32 גיגה-בייט זיכרון כמו RTX 3090, 4090 או 5090. המשקל של גרסת Q4_K_M הוא 16.5 גיגה-בייט, ואם רוצים לפתוח הקשר עבודה של 96K טוקנים חייבים את מלוא הזיכרון פנוי.

האם הוא מתאים לשימוש בעברית?

המודל מוגדר ומאומת לשפה האנגלית בלבד. הוא לא עבר אופטימיזציה או בדיקות בעברית, ולכן לא מתאים למשימות שדורשות הבנה או כתיבה מדויקת בשפה זו.

איך מריצים

המשקל בגרסת Q4_K_M תופס כ־16.5 גיגה-בייט, ומיועד לרוץ על כרטיס מסך בודד של 24 עד 32 גיגה-בייט דרך llama.cpp. למרות שההקשר המקורי מוגדר ל־262,144 טוקנים, בפועל נבדקה נקודת עבודה יציבה ב־96K שממלאת כרטיס של 32 גיגה-בייט בנוחות.

מומלץ להריץ אותו עם מצב חשיבה פועל ובטמפרטורה של 0.85 עד 1.0. אם אין לכם כרטיס מסך עם לפחות 24 גיגה-בייט זיכרון ייעודי, עדיף להשתמש ב־API מרוחק במקום לנסות לדחוף אותו לזיכרון מעבד רגיל שיאט את הריצה לקצב לא מעשי.

ollama run hf.co/Jackrong/Qwopus3.6-27B-Fusion-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון בעמוד מסומן כ־other, אך בתיעוד מצוין כי השימוש כפוף ישירות לרישיון הבסיס של Qwen. מדובר בנגזרת של מודלי מחקר אישיים ללא חלוקה מחדש של דאטה צד שלישי. לפני שילוב במוצר מסחרי צריך לבדוק את תנאי הרישיון המקוריים של משפחת Qwen3.6-27B.

הרישיון המלא בעמוד המודל ↗