GPT
Q

AtomicChat/Qwen3.8-27B-GGUF

קוד פתוח

AtomicChatרישיון לא דווח2026-08-12

  • gguf
  • llama.cpp
  • qwen3.8
  • qwen
  • imatrix

גרסת GGUF שעברה כיול מותאם אישית למודל מולטימודלי של 27 מיליארד פרמטרים. היא מציעה שילוב של ראייה וטקסט עם ביצועים מדויקים יותר מכיולים סטנדרטיים באותו נפח זיכרון.

  • 236 GBמשקל הקבצים
  • 300,981הורדות בחודש
  • 167לייקים

מה זה

מדובר במודל שמעבד תמונה וטקסט ומחזיר טקסט, המבוסס על ארכיטקטורה היברידית של 64 שכבות וראש לחיזוי מספר תווים במקביל. המפרסמים יצרו מערך קבצים מקווצים לפי מטריצת חשיבות מותאמת אישית, שבה חילקו את רמות הדיוק בין השכבות במקום להחיל דחיסה אחידה. התוצאה היא צמצום משמעותי של הסטייה ביחס למשקולות המקוריות בלי להגדיל את נפח הקובץ.

בבדיקות מול המקור בפורמט BF16, רמות הדחיסה הגבוהות כמו Q8_0 שומרות על 98.92% התאמה בבחירת המילה הבאה, ובקובצי ביניים כמו AD-Q4_K_M מגיעים ל־95.59% התאמה עם גודל של 17.1 גיגה-בייט. מעבר למלל, המודל מתמודד בהצלחה עם תמונות מורכבות, וזיהוי מדויק של כתב יד גותי נשמר בכל הגרסאות החל מ־AD-IQ3_S בנפח 13.8 גיגה-בייט.

מתאים ל

  • פענוח כתבי יד ותעודות

    רכיב הראייה מחזיק היטב בדחיסה ומפענח טקסט קליגרפי קשה ברמת דיוק גבוהה כבר מקובצי 13.8 גיגה-בייט.

  • הפעלת סוכנים וכלים מקומית

    רבע מנתוני הכיול התמקדו בשימוש בכלים ומבנה שיחה, מה שמספק יציבות בהפעלת פונקציות על חומרה מקומית.

  • שרת צ'אט עצמאי בינוני

    על כרטיס 24 גיגה-בייט יחיד אפשר לקבל ביצועי שפה חזקים של מודל 27B עם הקשר רחב יחסית לשימוש פנים-ארגוני.

איפה זה נופל

ההרצה המקומית סובלת מקפיצה חדה בשגיאות בדחיסות הנמוכות מ־14 גיגה-בייט, שם ההתאמה למקור צונחת אל מתחת ל־90%. בעיבוד תמונה קיימת דרישה קשיחה להגדרת מינימום של 1024 טוקנים לתמונה, שכן ללא הדגל הזה ההבנה המרחבית והמיקומים הופכים לבלתי אמינים לחלוטין. בנוסף, ראש החיזוי מרובה הטוקנים אינו מתכייל במטריצת החשיבות ונעול על דיוק קבוע, מה שמונע אופטימיזציה נוספת שלו.

שאלות
נפוצות

למה מופיעות שגיאות בטרמינל בזמן טעינת תמונה?

ההודעות על non-consecutive token position ותאי blk.64 שאינם בשימוש הן תקינות לחלוטין. ההודעה הראשונה נובעת מקידוד מיקום רב-ממדי של תמונות, והשנייה קשורה לראש חיזוי הטוקנים שאינו פעיל במעבר ישיר רגיל.

איזה קובץ כדאי להוריד לכרטיס עם 24 גיגה-בייט?

הקובץ המתאים ביותר הוא AD-Q5_K_M-Q4_K_M בנפח 18.6 גיגה-בייט. הוא משאיר מספיק זיכרון וידאו פנוי לחלון הקשר של כ־16,000 טוקנים בלי לגלוש לזיכרון המערכת.

איך מריצים

להרצה מלאה צריך את קובץ המודל, מנוע llama.cpp עדכני שתומך בארכיטקטורת qwen35, ואם רוצים לעבד תמונות חובה להוריד גם את מקרן הראייה mmproj-Qwen3.8-27B-F16.gguf. ניהול הזיכרון דורש תקציב גם למודל וגם להקשר, כאשר כל טוקן דורש 256 קילו-בייט של מטמון תשומת לב, מה שמסתכם ב־2 גיגה-בייט להקשר של 8k ו־8 גיגה-בייט להקשר של 32k. במערך של שני כרטיסי RTX 5090 עם קובץ AD-Q4_K_M, המערכת מפיקה 77 טוקנים לשנייה ביצירה בהקשר קצר.

כרטיסי 16 גיגה-בייט מוגבלים לגרסאות נמוכות כמו AD-IQ3_S סביב הקשר של 8k. כרטיסי 24 גיגה-בייט מחזיקים קבצים מאוזנים כמו AD-Q5_K_M-Q4_K_M עם הקשר של כ־16k. אם אין לכם לפחות כרטיס עם 24 גיגה-בייט ואתם חייבים הקשר ארוך ומלא, עדיף להשתמש בשירות ענן מנוהל.

ollama run hf.co/AtomicChat/Qwen3.8-27B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המודל לא דווח במאגר. במצב כזה אין הרשאה מפורשת לשימוש מסחרי, הפצה או שילוב במוצר תוכנה. לפני שמכניסים אותו לפיתוח מסחרי, יש לאתר את תנאי הרישיון של משקולות הבסיס המקוריות של Qwen או לבקש הבהרה מהיוצרים.

הרישיון המלא בעמוד המודל ↗