GPT
Q

Qwopus3.6-35B-A3B-Coder-MTP-GGUF

קוד פתוח

Jackrongapache-2.02026-06-29

  • transformers
  • gguf
  • llama.cpp
  • image-text-to-text
  • vision

מודל קוד מבוסס תערובת מומחים שמוותר בכוונה על שרשראות חשיבה ארוכות. הוא מתמקד בביצוע ישיר ומהיר של עריכות קוד, קריאות לכלים והרצת בדיקות כדי לחסוך טוקנים בלולאות עבודה אוטונומיות.

  • 124 GBמשקל הקבצים
  • 490,820הורדות בחודש
  • 237לייקים

מה זה

מדובר בכוונון עדין למודל MoE עם שלושים וחמישה מיליארד פרמטרים כוללים, שמתוכם רק כשלושה מיליארד פעילים בכל טוקן. הבסיס שלו מגיע ממשפחת Qwen3.6 דרך אנלאות', והמטרה כאן הפוכה מרוב מה שקורה היום בתחום: במקום לייצר פסקאות ארוכות של הרהורים לפני כל פעולה, הוא מתוכנת לחתוך ישר לביצוע הטכני. זה מורגש בעיקר בתהליכים מחזוריים שבהם סוכן תוכנה צריך לקרוא קובץ, להריץ טסט, לראות שגיאה ולתקן מיד.

בבדיקת SWE-bench על שלוש מאות משימות עם תיקוני קוד בפועל, גרסת הגינטוט Q5_K_M השיגה 62.4 אחוז הצלחה כשרכיב החשיבה כבוי לגמרי. במבחנים התנהגותיים הוא השיג ממוצע של 82.1 מול 78.9 של Ornith באותו גודל כשהאחרון רץ עם חשיבה דולקת. המספרים האלה מראים שבמשימות מעשיות כמו שכתוב קבצים ותיקון באגים, המודל הזה מתפקד ברמה של מודלים חושבים בלי לשרוף זמן וטוקנים על ניתוחים תיאורטיים.

מתאים ל

  • סוכני קוד מקומיים

    מתאים לשילוב בכלים כמו OpenHands כדי לבצע עריכות קבצים והרצת בדיקות מהירה ללא השהיות מיותרות.

  • ניפוי שגיאות אוטומטי

    מגיב ישירות לפלט של עקבות שגיאה ומתקן באגים בקוד בלי לבזבז טוקנים על הסברים ארוכים.

  • בניית הדגמות משחקים

    מייצר לוגיקה וקוד שלם בזמן קצר עבור אבות טיפוס, בדיוק כמו בהדגמת המשחק שצורפה לפרויקט.

איפה זה נופל

הוויתור על חשיבה מפורשת מגיע עם מחיר ברור. המודל חלש משמעותית במשימות שדורשות שליפה מהקשר ארוך מאוד, חשיבה על חשיבה, ועמידות להרעלת הקשר. הוא לא בנוי לתכנון ארכיטקטוני עמוק או להבנה מופשטת של בעיות הנדסיות מורכבות, אלא לביצוע טקטי מהיר. בנוסף, מדובר בגרסה ניסיונית של הקהילה שלא עברה בדיקות בטיחות מקיפות ולא נבחנה על משימות כלליות מעבר לפיתוח תוכנה.

שאלות
נפוצות

האם כדאי להפעיל במודל הזה מצב חשיבה?

לא, המודל אומן ונבדק במפורש כשהחשיבה מכובה כדי לחסוך טוקנים. הפעלת מנגנון חשיבה ארוך תפגע ביתרון המרכזי שלו ותחזיר את ההשהיות שהמפתחים ניסו לבטל.

האם המודל מתאים לפיתוח בעברית?

המודל מצהיר על תמיכה בחמש שפות בלבד: אנגלית, סינית, ספרדית, רוסית ויפנית. הוא מסוגל לקרוא ולכתוב קוד שמכיל מחרוזות בעברית, אבל לא מומלץ לבקש ממנו לנהל שיחות או לתעד פרויקטים בעברית.

איך מריצים

המשקל הכולל של הקבצים מגיע למאה עשרים וארבעה גיגהבייט המחולקים לשמונה קבצים, כך שצריך שטח אחסון נדיב וסביבת הרצה שתומכת בפורמט GGUF דרך transformers או llama.cpp. בגלל ארכיטקטורת המומחים הפעילים, כוח העיבוד הנדרש בזמן ריצה מקביל למודל קטן בהרבה, אבל כל שלושים וחמישה מיליארד הפרמטרים חייבים לשבת בזיכרון. תצטרכו כרטיס גרפי חזק של לפחות עשרים וארבעה גיגהבייט VRAM בשילוב זיכרון מערכת מהיר לחלוקת משאבים.

אם אתם בונים שירות שצריך לרוץ מקומית בלי תלות ברשת ובלולאות תכנות מהירות, ההרצה העצמית הגיונית לגמרי. לעומת זאת, אם המטרה היא רק לתת פקודת קידוד בודדת מדי פעם, עדיף לפנות לממשקי ענן קיימים במקום לתחזק שרת כבד ומערך קבצים של מאה גיגהבייט בשביל משימות מזדמנות.

ollama run hf.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗