GPT
Q

Qwopus3.6-35B-A3B-v1-GGUF

קוד פתוח

Jackrongapache-2.02026-05-06

  • transformers
  • gguf
  • llama.cpp
  • image-text-to-text
  • vision

מודל MoE שמחזיק 35 מיליארד פרמטרים אבל מפעיל רק 3 מיליארד לכל טוקן. הוא נותן מהירות ריצה חריגה ביחס לגודל, לצד יכולות ראייה ותכנות.

  • 105 GBמשקל הקבצים
  • 319,006הורדות בחודש
  • 224לייקים

מה זה

מדובר בהתאמה ממוקדת היגיון על בסיס Qwen3.6-35B-A3B של עליבאבא. בזכות ארכיטקטורת תערובת מומחים עם 256 מומחים ושילוב של מנגנון Gated DeltaNet, הוא שומר על צריכת זיכרון שטוחה ומהירות גבוהה מאוד. במבחן של Tekholms.aptm הוא קיבל ציון איכות של 94.2 ואמינות של 91.7 אחוז בקצב של 44 טוקנים לשנייה, ובבדיקה על כרטיס RTX 5090 נמדד קצב ממוצע של 161.9 טוקנים לשנייה.

האימון נעשה בשלושה שלבים של כוונון עדין מונחה בשיטת LoRA, תוך שילוב זיקוק ידע ממודל של 27 מיליארד פרמטרים. המפתח שם דגש על יציבות במענה לשאלות מורכבות ופליטת מבני JSON תקינים אחרי שלבי חשיבה ארוכים, במקום לקרוס באמצע התהליך כמו שקורה לעיתים במודלים כאלה.

בנוסף לשפה וראייה, המודל מכוון למשימות תכנות צד לקוח. לפי נתוני הבדיקות הוא מייצר קוד HTML ו־CSS שלם בפנייה אחת, כולל אנימציות ואינטראקציות, ולא רק שלד ראשוני שדורש השלמות ידניות.

מתאים ל

  • פיתוח ממשקי משתמש

    מייצר קוד HTML ו־CSS עובד בפנייה אחת כולל רכיבים אינטראקטיביים ואנימציות מורכבות.

  • חילוץ נתונים להקשר ארוך

    מתמודד עם חלונות הקשר גדולים ומוציא פלט JSON תקין גם אחרי תהליכי חשיבה ממושכים.

  • סוכני תוכנה מקומיים

    מציע קצב הפקה גבוה של עשרות טוקנים לשנייה וקריאה לכלים על כרטיס מסך בודד.

איפה זה נופל

היוצר מציין במפורש שהמודל שוחרר כגרסה ניסיונית לקהילה ללא בדיקות בטיחות מלאות וללא בדיקת ביצועים מקיפה. בנוסף, הכוונון בוצע על 9 אחוז מהפרמטרים בשיטת LoRA, יחס גבוה שמגדיל את הסיכון לאי יציבות ולבעיות במיזוג המשקולות בתוך ארכיטקטורת MoE. קיימות תקלות תאימות מוכרות בספריות כמו Transformers 5.x ו־Unsloth, כולל שגיאות ייבוא בזמן מיזוג. מבחינת שפות רשמיות נתמכות רק אנגלית, סינית, ספרדית, רוסית ויפנית, כך שעברית לא עברה אופטימיזציה ייעודית באימון.

אותה משפחה

Qwopus3.6 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ טוב על עברית?

השפות הרשמיות שצוינו במאגר כוללות אנגלית, סינית, ספרדית, רוסית ויפנית. עברית לא נכללת ברשימה הזו, ולכן איכות התחביר והבנת ההוראות בשפה לא מובטחות ודורשות בדיקה עצמאית לפני שימוש.

איך מפעילים את יכולות הראייה של המודל ב־llama.cpp?

כדי לנתח תמונות צריך להוריד את הקובץ הייעודי mmproj.gguf מדף המאגר. יש לשים אותו באותה התיקייה שבה נמצא קובץ המודל הראשי ולהגדיר לשרת לטעון אותו בזמן העלייה.

האם אפשר להשתמש בחלון הקשר של יותר מ־32 אלף טוקנים?

כן, המודל יורש תמיכה בעד 262 אלף טוקנים ממודל הבסיס. עם זאת, מכיוון שהאימון בוצע על דוגמאות באורך עד 32 אלף, חובה להפעיל סקיילינג מסוג YaRN או RoPE בהגדרות השרת כדי למנוע קריסה באיכות הפלט.

איך מריצים

המשקל הכולל של הקבצים במאגר עומד על 105 גיגה בייט המחולקים לשבעה קבצים בפורמט GGUF, מה שמחייב שטח דיסק מכובד וכרטיס מסך חזק כדי לטעון אותו במלואו. להרצה ב־llama.cpp עם תמיכה בראייה חובה להוריד גם את הקובץ mmproj.gguf ולהניח אותו באותה תיקייה. המודל אומן על אורך הקשר של 32 אלף טוקנים, אך תומך בהרחבה עד 128 אלף או 256 אלף טוקנים בעזרת הגדרות RoPE ו־YaRN בשרת ההרצה.

אם יש לכם כרטיס מסך מתקדם כמו RTX 5090 תקבלו ביצועים מקומיים גבוהים בלי תלות ברשת. אם אתם עובדים על מחשב נייד או כרטיס עם מעט זיכרון, עדיף לפנות ל־API חיצוני של שרתי ענן במקום לנסות לדחוף מודל של 35 מיליארד פרמטרים לזיכרון המקומי.

ollama run hf.co/Jackrong/Qwopus3.6-35B-A3B-v1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד, הפצה מחדש ושילוב במוצרים סגורים. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והרישיון המקורי, לצד ציון שינויים שבוצעו בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗