GPT
Q

Qwopus3.8-27B-Flash-GGUF

קוד פתוח

Jackrongapache-2.02026-09-04

  • transformers
  • gguf
  • llama.cpp
  • image-text-to-text
  • vision

גרסת פיין-טיונינג ל־Qwen3.8-27B שנועדה לקצר זמני ריצה ולמנוע חפירות בסוכנים אוטונומיים. המודל חותך טוקנים מיותרים ומאיץ פענוח.

  • 229 GBמשקל הקבצים
  • 113,295הורדות בחודש
  • 173לייקים

מה זה

המודל מבוסס על Qwen3.8-27B ועבר אימון בשני שלבים, סינון נתונים קפדני עם Unsloth וחיזוק באמצעות NeMo-RL ו־GSPO. המטרה הברורה פה היא יעילות בזמן ריצה של סוכנים, איפה שכל קריאה חוזרת גוררת שרשרת ארוכה של קריאות כלים והמתנה מצטברת.

התוצאות מראות פשרה מודעת. מצד אחד קצב הפענוח עלה ב־12.8% והמודל מייצר בממוצע 9.9% פחות תווים במקצועות מדעיים, בלי להיגרר להסברים אינסופיים. מצד שני, במבחן MMLU-Pro הדיוק ירד מ־92.73% במודל הבסיס ל־91.28%. בסוללת בדיקות של 14 משימות הנדסת תוכנה הוא סיים 13 בהצלחה, בעיקר כי הוא מגיע לפתרון בפחות סיבובים.

מתאים ל

  • סוכני פיתוח אוטונומיים

    הוא מסיים משימות בפחות טוקנים וחוסך דקות יקרות של המתנה בלולאות עבודה.

  • פענוח עם מנגנון MTP

    מציג קבלת טיוטות של 80.7% שמאיצה משמעותית את הפקת הפלט על חומרה תואמת.

  • תיקון באגים ורפקטורינג

    עבר בהצלחה 13 מתוך 14 משימות קוד מורכבות מול בדיקות חבויות מחמירות.

איפה זה נופל

הבעיה הידועה ביותר כרגע היא הזחות שגויות שנוצרות לעיתים בקוד פייתון. מעבר לזה, במשימת כתיבת פארסר המודל נכשל כי נכנס ללולאת ריצה אינסופית ולא עצר בזמן, למרות שהקוד עצמו כבר עבר את הבדיקות. הוא פחות מדויק ממודל הבסיס בבחינות ידע כלליות, ויציבות הריצה שלו עדיין תלויה מאוד בסביבת הכלים ובהנחיות שתגדירו לו.

אותה משפחה

Qwopus3.8-27B-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

השפות המוצהרות בכרטיס הן אנגלית, סינית, ספרדית, רוסית ויפנית בלבד. אין אזכור לתמיכה בעברית, ולכן לא הייתי בונה עליו לעיבוד שפה טבעית בעברית בלי לבדוק אותו קודם.

למה שהדיוק במבחנים יירד לעומת מודל הבסיס?

האימון כוון לצמצם מלל עודף וזמני חישוב, מה שגרם לירידה של 1.45 נקודות אחוז ב־MMLU-Pro. בתמורה קיבלו תגובות מהירות יותר ופחות היסחפות בנימוקים ארוכים מדי.

איך מריצים

כדי להריץ אותו מקומית צריך שרת llama.cpp עם תמיכה ב־MTP. הבדיקות שפורסמו רצו על כרטיסי מסך כמו RTX 5090, V100 ו־GB10, כאשר בסוללת הסוכנים השתמשו בפורמט Q5_K_M עם זיכרון מטמון q8_0 ומצב חשיבה מכובה.

אם אין לכם כרטיס עם מספיק זיכרון וידאו להחזיק מודל של 27 מיליארד פרמטרים יחד עם חלון הקשר סביר, עדיף להשתמש ב־API של שירות ענן. המודל שווה את הטרחה המקומית רק אם יש לכם את החומרה המתאימה ואתם מריצים לולאות סוכנים שדורשות תגובה מהירה.

ollama run hf.co/Jackrong/Qwopus3.8-27B-Flash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה של המודל במוצרים שלכם. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗