GPT
Q

Qwopus3.6-27B-v2-MTP-GGUF

קוד פתוח

Jackrongapache-2.02026-05-21

  • transformers
  • gguf
  • llama.cpp
  • image-text-to-text
  • vision

גרסה מכווננת של Qwen3.6-27B שמשלבת חיזוי מרובה טוקנים כדי לקצר זמני המתנה. מתאימה למי שצריך מודל חשיבה וקוד מקומי בלי להירדם מול המסך.

  • 95.2 GBמשקל הקבצים
  • 325,327הורדות בחודש
  • 393לייקים

מה זה

הפיתוח הזה לוקח את הדגם הצפוף של Qwen3.6-27B ומכוון אותו לתחומי פיתוח תוכנה, DevOps, לוגיקה ומתמטיקה. הייחוד כאן הוא שילוב של ראשי MTP, שמאפשרים חיזוי ספקולטיבי של כמה טוקנים במקביל. במקום לחכות לטוקן בודד בכל צעד, תהליך ההסקה מתקצר בצורה ניכרת.

בבדיקה המקומית של 30 שאלות מורכבות על שרת ייעודי, קצב הפליטה עלה מ־6.29 ל־10.46 טוקנים לשנייה מול מודל הבסיס. מעבר למהירות הגולמית, הוא מייצר תשובות תמציתיות יותר, עם ירידה של כ־27.7 אחוז במספר הטוקנים הכולל, מה שחתך את זמן הריצה הכולל ביותר מחצי.

מתאים ל

  • סיוע בכתיבת קוד ובדיקות

    מייצר קטעי קוד וסקריפטים מהר יותר ממודל הבסיס הודות לראשי החיזוי המרובים.

  • בניית תהליכי DevOps

    מתמחה בהפקת פקודות תשתית ונוהלי עבודה מובנים הדורשים דיוק טכני.

  • פתרון בעיות לוגיקה

    מספק מסלולי חשיבה הנדסיים מובנים בזמן תגובה קצר משמעותית.

איפה זה נופל

יוצרי המודל מדגישים שמדובר בשחרור קהילתי ניסיוני שמיועד למחקר והערכה, ולא במוצר אפוי לייצור. הוא לא תומך בעברית, והאימונים שלו כוונו לשפות כמו אנגלית, סינית ורוסית. מעבר לזה, התשובות שלו קצרות יותר במכוון, מה שעלול לפגוע בפירוט במשימות שדורשות הסברים רחבים ומעמיקים.

שאלות
נפוצות

האם המודל ירוץ על מחשב נייד חזק?

לא. משקל הקבצים עומד על מעל 95 גיגה בייט עבור 27 מיליארד פרמטרים. נדרשת חומרת שרתים מקצועית עם זיכרון וידאו גדול מאוד.

האם הוא מבין עברית?

השפות שצוינו במפורש הן אנגלית, סינית, קוריאנית, רוסית, יפנית וספרדית. עברית לא נתמכת רשמית ולא מומלץ לבנות עליו לפרויקטים מקומיים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־95.2 גיגה בייט בחלוקה לשמונה קבצים, כך שצריך שרת מקומי רציני כדי לטעון אותו, בדומה לחומרת GB10 שבה נבדק. הריצה מתבצעת מעל llama-server עם תמיכה בחיבורי צ'אט סטנדרטיים.

אם אין ברשותכם כרטיסי מסך עם נפח זיכרון ייעודי גדול מספיק להחזקת 27 מיליארד פרמטרים והקשר רחב, עדיף להשתמש במודל מרוחק דרך API. תחזוקת שרת מקומי למודל כזה יקרה ומסורבלת למי שרק רוצה לבצע שאילתות קוד מזדמנות.

ollama run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. הוא מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗