GPT
Q

Qwen3.8-27B-GSQ-RCO-GGUF

קוד פתוח

ISTA-DASLabapache-2.02026-08-28

  • gguf
  • gsq
  • rco
  • quantization
  • mixed-precision

גרסאות מכווצות של מודל שפה ותמונה עם 27 מיליארד פרמטרים. הן מיועדות למי שרוצה להריץ מודל חזק מקומית בלי לאבד ביצועים במתמטיקה ובקוד.

  • 75.8 GBמשקל הקבצים
  • 479,597הורדות בחודש
  • 745לייקים

מה זה

המאגר מכיל קובצי GGUF של המודל Qwen3.8-27B בארבע רמות דחיסה שונות, לצד קובץ נפרד של 0.9 גיגה בייט עבור מעבד התמונה. במקום לכווץ את כל המשקולות באותה צורה, החוקרים חישבו רגישות לכל טנזור בנפרד והקצו לו דיוק שונה תחת מגבלת נפח כוללת. התוצאה רצה ישירות בתוכנות מוכרות כמו llama.cpp, אולמה ו־LM Studio בלי צורך בהתאמות מיוחדות.

התוצאות מראות שהכיווץ כמעט לא פגע ביכולות הבסיס. גרסת IQ3_S, ששוקלת 11.8 גיגה בייט בלבד לעומת 53.8 גיגה בייט במקור, משחזרת במדויק ציון של 100 במבחן AIME25 וציון של 85.71 ב־LiveCodeBench v6, לצד ירידה זניחה של חצי אחוז במבחן GPQA-Diamond. אפילו בגרסה המצומצמת ביותר של 8.4 גיגה בייט, המודל שומר על יתרון ניכר במבחני היגיון מול שיטות כיווץ מתחרות באותו הגודל.

מתאים ל

  • פתרון בעיות מתמטיקה

    גרסת IQ3_S שומרת על ציון מושלם במבחן AIME25 ומתאימה לעיבוד שאלות מורכבות מקומית.

  • יצירת קוד בסביבה מבודדת

    תוצאה של 85.71 ב־LiveCodeBench v6 מאפשרת להריץ עוזר פיתוח עצמאי בלי להוציא קוד החוצה.

  • ניתוח מסמכים ותמונות

    שילוב קובץ ה־mmproj מאפשר לעבד תמונות לצד טקסט ישירות על המחשב.

איפה זה נופל

הפגיעה העיקרית מורגשת ברמות הדחיסה האגרסיביות. בגרסת IQ2_XS הציון ב־LiveCodeBench v6 צונח ל־76.57 לעומת 85.71 במקור, ומבחן GPQA-Diamond יורד ל־84.85. בנוסף, מי שבונה על יכולות ראייה ממוחשבת חייב לטעון קובץ נוסף בנפרד, מה שמגדיל את צריכת הזיכרון מעבר למשקל קובץ השפה עצמו.

שאלות
נפוצות

איזו גרסה כדאי להוריד למחשב עם 16 גיגה זיכרון גרפי?

הבחירה העדיפה היא IQ3_S ששוקלת 11.8 גיגה בייט. היא נותנת ביצועים זהים למודל המלא ומשאירה כארבעה גיגה בייט לקובץ התמונה ולחלון ההקשר.

מה נותנים קובצי ה־mtp במאגר?

אלו קבצים שמכילים ראש חיזוי מרובה טוקנים לצורך speculative decoding ב־llama.cpp. הם מוסיפים כ־0.35 גיגה בייט לנפח ומאיצים את קצב הפקת הטקסט בלי לשנות את התוכן.

איך מריצים

המודל רץ ישירות דרך llama.cpp, אולמה או LM Studio. כדי להשתמש ביכולות עיבוד תמונה מורידים את קובץ המודל הנבחר יחד עם קובץ ה־mmproj ששוקל כמעט גיגה בייט אחד. יש גם גרסאות mtp שמוסיפות 0.35 גיגה בייט ותומכות בפענוח ספקולטיבי להאצת מהירות הפלט.

לרוב המשתמשים גרסת IQ3_S בנפח 11.8 גיגה בייט תהיה נקודת העבודה הנכונה, והיא דורשת כרטיס מסך עם לפחות 16 גיגה בייט זיכרון כדי להשאיר מקום לקונטקסט. אם הזיכרון מוגבל ל־12 גיגה בייט, גרסת IQ2_XS בנפח 8.4 גיגה בייט תיכנס פנימה. אין כאן שירות ענן או תמחור לפי קריאה, כך שאם אין לכם כרטיס מתאים, תצטרכו להרים שרת ייעודי בעצמכם.

ollama run hf.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF:IQ2_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗