GPT
Q

Qwen3.8-27B-XYZ

קוד פתוח

quimmedesapache-2.02026-08-14

  • gguf
  • qwen
  • qwen3.5
  • multimodal
  • vision

גרסת GGUF ייעודית לכתיבת קוד שמבוססת על מודל 27B היברידי. היא שומרת על רמת דיוק גבוהה בשכבות החיוניות לתכנות גם במשקלים נמוכים.

  • 428 GBמשקל הקבצים
  • 58,092הורדות בחודש
  • 48לייקים

מה זה

מדובר בכיול מכוון של המודל המקורי, שתוכנן מראש עבור פיתוח תוכנה בלבד ולא למענה על שאלות כלליות. הארכיטקטורה משלבת מנגנון SSM עם שכבות קשב מלאות בכל שכבה רביעית, יחד עם שכבת חיזוי להאצת פעולת הפענוח. בתהליך הכימות השאירו את חלקי הרשת הרלוונטיים לכתיבת קוד ברמת דיוק של BF16, במקום לדחוס את כל המשקלים בצורה עיוורת.

הבדיקות שבוצעו על הגרסה הזו התמקדו בסט מבחנים של קוד, כדי לוודא ששגיאות התחביר וההיגיון נשארות נמוכות. מי שמחפש ידע בתחומי היסטוריה, ביולוגיה או מדעי החברה יקבל תוצאות פחות טובות כאן ביחס לגרסאות הרגילות של המודל.

מתאים ל

  • השלמת קוד מקומית ב־IDE

    מאפשר עבודה מקומית ומהירה בזכות שכבת החיזוי המובנית, ללא דליפת קוד פרטי החוצה.

  • ניתוח ותרגום דיאגרמות לקוד

    חיבור קובץ הראייה מאפשר להזין צילומי מסך או תרשימים ישירות לתוך כלי הפיתוח.

  • בדיקות וניפוי שגיאות בקוד

    המודל עבר התאמה ייעודית למבני תוכנה כדי לשמור על עקביות בפתרון בעיות מורכבות.

איפה זה נופל

המודל חלש בידע כללי כי הכימות לא הותאם לתחומים האלה. בנוסף, הקבצים המכווצים ביותר, כמו Q1 ו־Q2 שיורדים מתחת ל־2.5 ביט לפרמטר, נוטים להזיות חמורות ועלולים להיתקע בלולאות חשיבה אינסופיות בחלק מהמשימות. כדי לייצב אותם חייבים להפעיל דוגם DRY ולהקשיח את הגדרות הדגימה.

שאלות
נפוצות

האם כדאי להוריד את גרסאות ה־Q1 או ה־Q2?

לא מומלץ למשימות פיתוח שוטפות. הקבצים האלה אמנם שוקלים בין 6 ל־8 גיגה־בייט, אבל מנגנון ההיגיון נוטה להיתקע בהם בלולאות. הם מיועדים בעיקר למצבי חירום שבהם הזיכרון מוגבל לחלוטין.

האם אפשר להשתמש במודל הזה לעוזר וירטואלי כללי בארגון?

עדיף שלא. יוצרי הכימות הדגישו שהם הקריבו דיוק בתחומי ידע כללי כדי לשפר את תוצרי הקוד. מודל רגיל באותו גודל יעשה עבודה טובה בהרבה על שאלות כלליות או כתיבת מסמכים.

איך מריצים

טוענים את קובצי ה־GGUF ישירות דרך llama-server, ומקבלים שרת מקומי שתואם למבנה הנתונים של OpenAI. אפשר לחבר אליו גם קובץ ראייה ייעודי במשקל 0.87GB כדי לקבל יכולת ניתוח תמונות, ולהפעיל פענוח מהיר בעזרת שכבת החיזוי המובנית.

כרטיס מסך עם 24GB של זיכרון יריץ בנוחות את גרסת Q5 שתופסת 16.61GB, יחד עם חלון הקשר מלא של 128 אלף טוקנים. אם יש לכם כרטיס של 16GB, תצטרכו להסתפק בגרסת Q3 שתופסת 10.39GB, או להגביל את ההקשר ל־64 אלף טוקנים כדי להשאיר מקום לפענוח המהיר.

ollama run hf.co/quimmedes/Qwen3.8-27B-XYZ:Qwen3.8-27B-ULTRA-XYZ-v2

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 המלא. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו בתוך שירותים בתשלום ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗