GPT
Q

AtomicChat/Qwen3.8-Flash-Next-GGUF

קוד פתוח

AtomicChatother2026-08-26

  • gguf
  • atomic-chat
  • qwen
  • qwen3.8
  • flash-next

גרסת GGUF ניסיונית למודל של 177 מיליארד פרמטרים שרץ על מחשב עם 64 גיגה זיכרון. טבלת ענק נשארת על הדיסק, והשאר נכנס לכרטיס המסך.

  • 272 GBמשקל הקבצים
  • 43,773הורדות בחודש
  • 108לייקים

מה זה

הארכיטקטורה כאן שונה ממה שהתרגלתם לראות. הבסיס כולל 125 מיליארד פרמטרים בתצורת תערובת מומחים שמפעילה רק 6 מיליארד לכל טוקן, לצד שכבת חיזוי טוקנים של 4 מיליארד וטבלת הטמעות של 51 מיליארד פרמטרים. השילוב הזה נותן מהירות גבוהה במיוחד, ועל מקבוק עם מעבד M5 Max הוא מייצר 36 טוקנים לשנייה בקובץ של 85 גיגה.

המדידות של המפרסמים מראות שגרסת 4.27 ביט למשקל מגיעה לציון שגיאה יחסית כמעט זהה לגרסת 5.00 ביט, עם דיוק זהה בבחירת הטוקן המוביל ב־89.49% מהמקרים לעומת מודל הבסיס. המודל כולל חלון הקשר טבעי של 262,144 טוקנים, אבל הקבצים האלה מכסים כרגע רק את מסלול הטקסט בלי יכולות הראייה של מודל המקור.

מתאים ל

  • פיתוח סוכנים מרובי שלבים

    ארכיטקטורת הקשב המהירה וחלון ההקשר הגדול מתאימים למשימות ארוכות שדורשות מעקב אחרי פעולות מרובות.

  • פתרון בעיות קוד מורכבות

    תוצאות המבחנים מציגות ביצועים חזקים במבחני תכנות מרובי שפות והסקה לוגית.

  • הרצה מקומית על מחשבי מק

    הפרדת הטבלה לכונן מאפשרת להריץ מודל של 177 מיליארד פרמטרים על תחנת עבודה עם 64 גיגה זיכרון.

איפה זה נופל

המודל דורש תמיכה ייעודית שאינה קיימת בכל גרסאות התוכנה הנפוצות. טבלת ההטמעות מכילה 51.2 מיליארד פרמטרים שכווצו בצורה עיוורת בלי מטריצת חשיבות כי כלי הכיווץ לא אוסף עליה נתונים. בנוסף, שכבות הפיד־פורוורד אינן מתחלקות ב־256, מה שמאלץ שימוש בשיטות כיווץ ספציפיות ומונע כיווץ אגרסיבי במיוחד.

שאלות
נפוצות

איך קובץ של 85 גיגה רץ על מחשב עם 64 גיגה זיכרון?

39 גיגה מתוך הקובץ שייכים לטבלת הטמעות שיושבת על כונן ה־SSD ונקראת ישירות ממנו לפי הצורך. הזיכרון בפועל מחזיק רק את משקלי המודל הפעילים, שתופסים כ־46 עד 55 גיגה בהתאם לרמת הכיווץ שבחרתם.

איזו גרסת כיווץ מומלץ להוריד מבין האפשרויות?

הגרסה המאוזנת ביותר היא AD-4.27bpw שמשתמשת ב־Q4_K_M. היא מציגה תוצאות שוות ערך לגרסת 5 ביט, חוסכת 17.6 גיגה של נפח, ומשאירה מספיק זיכרון פנוי לחלון הקשר גדול.

האם אפשר להשתמש במודל הזה לעיבוד תמונות?

המודל המקורי כולל יכולות ראייה, אך קובצי ה־GGUF שפורסמו כאן מיועדים למסלול הטקסט בלבד. כדי להפעיל עיבוד תמונה מקומי תצטרכו להוסיף קובץ מקרן תואם עם פקודת ההרצה הייעודית.

איך מריצים

בשביל להריץ אותו צריך גרסה מעודכנת של llama.cpp שתומכת בארכיטקטורת qwen4exp. הטריק המרכזי הוא שמירת מיפוי הזיכרון פועל כדי שטבלת ההטמעות תישאר על כונן ה־NVMe ולא תיכנס ל־RAM, מה שדורש שהטבלה תשב בקובץ נפרד משאר המשקלים.

חייבים להגדיר דגל התאמת פרמטרים כבוי, כי המנגנון האוטומטי נכשל בהקצאת זיכרון למבנה הזה, ולהשתמש בתבנית השיחה המקורית כדי למנוע פלט משובש. אם אין לכם לפחות 55 גיגה של זיכרון מאוחד או VRAM פנוי וכונן מהיר לקריאות אקראיות, עדיף לפנות ל־API חיצוני במקום לנסות להריץ אותו מקומית.

ollama run hf.co/AtomicChat/Qwen3.8-Flash-Next-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

104 קבצים במאגר, 272 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל המקורי שוחרר תחת רישיון Qwen Community License 1.0, בעוד שדף המודל הנוכחי מסווג אותו תחת other. השימוש המסחרי תלוי בתנאי הרישיון המקורי של עליבאבא, שכוללים בדרך כלל מגבלות על כמות משתמשים חודשית. אם אתם בונים מוצר מסחרי, חובה לבדוק את תנאי הרישיון של Qwen לפני הפצה.

הרישיון המלא בעמוד המודל ↗