GPT
Q

Qwen3.8-27B-Ridge-GGUF

קוד פתוח

empero-aiapache-2.02026-08-15

  • gguf
  • llama.cpp
  • quantized
  • qwen3.8
  • qwen3.5

גרסת קוונטיזציה מיוחדת שמכווצת מודל 27B לגודל שרץ על כרטיס ביתי בלי לרסק שכבות קריטיות. הפתרון פונה למי שצריך מודל חשיבה וראייה מקומי ורוצה מהירות גבוהה.

  • 12.6 GBמשקל הקבצים
  • 476,414הורדות בחודש
  • 339לייקים

מה זה

מדובר בהמרה בפורמט GGUF של הדגם הרשמי Qwen3.8-27B, שמטפל בטקסט ובתמונות בשפות אנגלית וסינית. הייחוד כאן הוא בטיפול בארכיטקטורה ההיברידית של המודל, המשלבת שכבות Gated-DeltaNet עם שכבות תשומת לב רגילות. במקום לדחוס את כל השכבות באותה צורה גסה, היוצרים השאירו את נתיבי המצב הרגישים של הרשת ברמת דיוק גבוהה של שמונה ביטים, וחסכו מקום על חשבון שכבות אחרות.

התוצאה היא קובץ טקסט במשקל 11.73 גיגה בייט ששומר גם על רכיב הניחוש המקורי להאצת הפלט. במבחן פרפלקסיטי על טקסטים דמויי ויקיפדיה, הדגם השיג תוצאה של 7.82 לעומת 7.15 בגרסת המקור הלא מכווצת. העלייה הזו של תשעה אחוזים מעידה על פגיעה מדודה בלבד באיכות הטקסט תמורת חיתוך משמעותי במשקל הקובץ.

מתאים ל

  • הסקה מקומית על כרטיס יחיד

    משקל של פחות מ־12 גיגה בייט נכנס בכרטיס 16 או 24 גיגה בלי צורך בחומרת שרתים יקרה.

  • ניתוח תמונות באנגלית וסינית

    שילוב קובץ הראייה מאפשר עיבוד קלט חזותי וטקסטואלי מקומי בשפות הנתמכות בלי שליחת מידע החוצה.

  • עבודה עם מודל חשיבה

    ברירת המחדל מפיקה מקטעי חשיבה מובנים שמתאימים למשימות שדורשות תכנון לפני מענה.

איפה זה נופל

החיסרון הברור ביותר הוא הפגיעה בדיוק, שהתבטאה בעלייה של תשעה אחוזים במדד השגיאה מול גרסת הבסיס. בנוסף, מנגנון האצת הניחוש המובנה בקובץ תלוי לחלוטין בתמיכה של סביבת הריצה שלכם, ובלעדיה המודל ירוץ בקצב רגיל בלי לקצר זמנים. מעבר לזה, המודל מוגדר רשמית לאנגלית וסינית בלבד, כך שלא כדאי לבנות עליו לעיבוד שפה טבעית בעברית מורכבת.

שאלות
נפוצות

האם אני חייב להוריד את שני הקבצים כדי להתחיל לעבוד?

לא. אם המטרה היא עבודה עם טקסט בלבד, מספיק להוריד את קובץ המודל הראשי ששוקל 11.73 גיגה בייט. הקובץ השני, ששוקל פחות מגיגה בייט, נחוץ רק אם אתם מתכננים להזין למודל תמונות.

איך מבטלים את בלוק החשיבה בתשובות?

אפשר לכבות את החשיבה ישירות דרך הגדרות ההרצה בסביבה שלכם, למשל באמצעות הפקודה המתאימה ב־llama.cpp. במצב זה כדאי להוריד את הטמפרטורה לאזור אפס נקודה שבע כדי לקבל תשובות ישירות וממוקדות.

האם כרטיס של 16 גיגה יספיק לשיחות ארוכות במיוחד?

הוא יספיק רק להקשר קצר עד בינוני. המודל תומך עקרונית בהקשר של מאות אלפי טוקנים, אבל שמירת המידע בזיכרון תמלא כרטיס של 16 גיגה מהר מאוד, לכן בהקשר ארוך חובה כרטיס גדול בהרבה.

איך מריצים

בשביל להריץ אותו צריך כרטיס מסך עם 16 גיגה זיכרון כנקודת פתיחה, אבל כרטיס של 24 גיגה ייתן מרווח נשימה אמיתי לטעינת התמונות ולשמירת היסטוריית השיחה. הטקסט נמצא בקובץ הראשי, ואם רוצים קלט תמונה מורידים גם קובץ נוסף של פחות מגיגה בייט ומפעילים אותו דרך ספריות מוכרות כמו llama.cpp או Ollama.

במבחן ביצועים על כרטיס חזק מסוג RTX PRO 6000 עם 96 גיגה זיכרון, המודל ייצר כחמישים וארבעה טוקנים בשנייה. אם אתם מתכוונים לפתוח חלון הקשר ענק שמגיע למאות אלפי טוקנים, צריכת הזיכרון של ההקשר תחנוק את הכרטיס המקומי בלי קשר למשקל הקובץ, ובמצב כזה עדיף לשלם לפי שימוש לספק ענן.

ollama run hf.co/empero-ai/Qwen3.8-27B-Ridge-GGUF:BF16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 12.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או מוצרית. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים וציון הרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗