GPT
Q

Qwopus3.6-27B-Fusion-GGUF

קוד פתוח

KyleHessling1other2026-07-20

  • gguf
  • merge
  • task-vector
  • dare-ties
  • layer-weighted

שילוב משקלים שמחבר מודל חשיבה עם מודל קוד כדי לייצר סוכן פיתוח עצמאי. הוא פותר באגים בעצמו ומתאים למי שרוצה להריץ לולאות תכנות מקומיות בלי לקרוס בלולאות אינסופיות.

  • 146 GBמשקל הקבצים
  • 293,589הורדות בחודש
  • 78לייקים

מה זה

מדובר במיזוג מותאם אישית של שני מודלים שנגזרו מאותו בסיס של עשרים ושבעה מיליארד פרמטרים, אחד להסקה לוגית והשני לתכנות. המפתח גילה שהזרקת יכולות הקוד לשכבות המאוחרות תוך שמירה על שכבות ההסקה המוקדמות מונעת את חוסר היציבות של מודל הקוד המקורי בטמפרטורות נמוכות. הוא שומר על מצב חשיבה פועל כברירת מחדל ויודע לנתח שגיאות של בדיקות אוטומטיות, לאתר את שורש התקלה ולתקן את הקובץ בלי התערבות ידנית.

במדדי ביצועים הוא מציג תוצאות גבוהות של 94.5% במבחן HumanEval ו־87.9% ב־MBPP, לצד 95% במתמטיקה בסיסית של GSM8K. במבחן תכנות מעשי על מקטע מתוך SWE-bench הוא פתר שבע מתוך חמש עשרה בעיות. ההבדל המרכזי בינו לבין מודלים אחרים בגודל הזה הוא היכולת לסיים פלט בצורה נקייה גם בטמפרטורה נמוכה של 0.2 וגם בטמפרטורה של 0.9, לצד תמיכה בקלט תמונה באמצעות קובץ מקרן נפרד.

מתאים ל

  • פיתוח אפליקציות ומשחקים

    יצירת קובץ קוד שלם של HTML ו־JS בלולאה סגורה שבודקת שגיאות ומתקנת את עצמה.

  • פתרון באגים מול בדיקות

    קריאת דוחות שגיאה של Playwright, הבנת הבעיה הלוגית בקוד ושכתוב הקטעים השבורים.

  • ניתוח מסכים וקוד משולב

    טעינת צילומי מסך של ממשקי משתמש יחד עם קובץ המקרן לזיהוי טקסט ותיקון שגיאות תצוגה.

איפה זה נופל

המודל הזה לא עבר תהליכי יישור בטיחות מלאים, בדיקות עמידות מקיפות או התאמות מסוג RLHF, כך שהוא יורש את כל ההטיות והמגבלות של מודל הבסיס. במשימות מורכבות של סוכני תכנות הוא נוטה לעיתים לחשוב יותר מדי, להתפזר בניתוחים עצמיים ולהגיע לתקרת הטוקנים בלי להחזיר את הפתרון בפועל. כדי להימנע מזה צריך להגביל מראש את אורך הפלט המרבי לאזור שמונת אלפים טוקנים. בנוסף, מדד התכנות המעשי נבדק על מדגם זעיר של חמש עשרה בעיות בלבד, מה שלא מוכיח עליונות מובהקת בעולם האמיתי.

שאלות
נפוצות

האם המודל דורש חיבור אינטרנט כדי לחשוב ולתכנת?

לא, המודל רץ כולו מקומית דרך llama.cpp על המחשב שלכם. אתם מזינים לו פרומפט או מחברים אותו לשרת מקומי, וכל תהליך החשיבה והקידוד מתבצע על גבי כרטיס המסך שלכם.

איך מחברים אליו תמונות בפועל?

צריך להוריד את קובץ המקרן הנפרד ששוקל כחצי גיגה בייט ולהוסיף את הדגל המתאים בפקודת ההרצה של השרת. משם אפשר להעביר לו תמונות וצילומי מסך במבנה הבקשות הרגיל.

למה להשתמש במיזוג הזה ולא במודל הקוד המקורי?

מודל הקוד המקורי נוטה לאבד יציבות ולהיתקע בלולאות כשהוא מנסה לחשוב בטמפרטורות נמוכות. המיזוג הזה שומר על היציבות של מודל ההסקה בלי לוותר על איכות כתיבת הקוד.

איך מריצים

הגרסה העיקרית שנבדקה היא שוקלת 16.5 גיגה בייט בפורמט Q4_K_M, והיא רצה במלואה על כרטיס מסך בודד עם 24 עד 32 גיגה זיכרון דרך llama.cpp. אפשר להשתמש בהקשר עבודה של עד 96 אלף טוקנים בתוך מגבלת הזיכרון הזו, אף שהארכיטקטורה תומכת תיאורטית בהרבה יותר. אם מחברים את קובץ הראייה הנפרד, צריך לשריין עוד כגיגה בייט של זיכרון גרפי.

מומלץ להריץ את המודל בטמפרטורה גבוהה של 0.85 עד 1.0 כדי לקבל את מרב היצירתיות, למרות שהוא לא קורס גם בערכים נמוכים. אם אין לכם כרטיס מסך מקומי חזק מספיק או שאתם צריכים להריץ משימות במקביל לכמה משתמשים, עדיף להשתמש ב־API מסחרי כי הקובץ נבדק ותועד בעיקר להרצה של תהליך בודד בכל פעם.

ollama run hf.co/KyleHessling1/Qwopus3.6-27B-Fusion-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כמותאם אישית וכפוף ישירות לתנאי הרישיון של מודל הבסיס של Qwen. הקבצים מכילים שילוב משקלים מחקרי וללא חומרי אימון חיצוניים, אך מי שרוצה להטמיע את המודל במוצר מסחרי חייב לבדוק מראש את ההגבלות של חברת האם ולוודא שהשימוש עומד בכללי ההפצה שלה.

הרישיון המלא בעמוד המודל ↗