GPT
Q

Qwen3-128k-30B-A3B-NEO-MAX-Imatrix-gguf

קוד פתוח

DavidAUapache-2.02025-05-08

  • gguf
  • all use cases
  • creative
  • creative writing
  • all genres

גרסת כיול מיוחדת של Qwen3 שמרחיבה את חלון ההקשר ל־128 אלף טוקנים. היא מיועדת למי שרוצה להריץ מודל מומחים של 30 מיליארד פרמטרים גם על מעבד רגיל בלי לשבור את התקציב.

  • 519 GBמשקל הקבצים
  • 1,790הורדות בחודש
  • 38לייקים

מה זה

בבסיס נמצא מודל תערובת מומחים של 30 מיליארד פרמטרים שמשתמש רק ב־3 מיליארד בכל רגע נתון, כשבדרך כלל שמונה מתוך 128 המומחים מופעלים לפי הקלט. ההקשר הורחב מ־32 אלף ל־128 אלף באמצעות YARN, והקובץ עבר תהליך כיול מותאם שמאפשר להגיע לרמות דיחוס נמוכות מאוד כמו IQ1_M ועדיין להפיק פלט הגיוני.

המדידות בכרטיס מראות על כרטיס RTX 4060 Ti מהירויות של 70 עד 87 טוקנים לשנייה ברמות הדיחוס הנמוכות והבינוניות, לעומת 15 עד 29 טוקנים לשנייה בריצה על מעבד וזיכרון בלבד. בפועל, החישוב הקל של המומחים הפעילים מאפשר לקבל קצב עבודה שמיש לחלוטין גם ללא מאיץ גרפי, אבל דיחוס כבד כמו IQ1 דורש פרומפטים מפורטים ומכוונים כדי לפצות על אובדן הדיוק.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון הקשר של 128 אלף טוקנים מאפשר לקרוא קבצים גדולים במלואם בלי קיצוצים.

  • הרצה מקומית על מעבד

    הפעלת 3 מיליארד פרמטרים מתוך 30 נותנת קצב סביר לחלוטין גם ללא כרטיס מסך ייעודי.

  • משימות חשיבה מורכבות

    פרומפט המערכת מאפשר להפעיל שרשרת חשיבה מובנית בתגיות ייעודיות לפתרון בעיות.

איפה זה נופל

המודל אינו כולל תמיכה מדווחת בעברית ברשימת השפות, ולכן עיבוד טקסט מקומי ידרוש בדיקה קפדנית של איכות הפלט לפני כל שימוש. בנוסף, גרסאות הדיחוס הנמוכות במיוחד כמו IQ1 סובלות מחזרתיות ומחייבות קנס חזרתיות של 1.1 והנחיות מפורטות מאוד. אם לא מגדירים ידנית פרומפט מערכת שמפעיל תגיות חשיבה, מנגנון ההסקה כבוי כברירת מחדל.

שאלות
נפוצות

האם המודל יעבוד טוב על מחשב בלי כרטיס מסך?

כן, בזכות ארכיטקטורת המומחים שמעבדת רק 3 מיליארד פרמטרים בפועל בכל רגע. בגרסאות הדיחוס הבינוניות והנמוכות תוכלו לקבל בין 15 ל־29 טוקנים לשנייה על מעבד מהיר עם זיכרון DDR5.

מה קורה אם מריצים אותו בלי פרומפט מערכת מיוחד?

המודל יעבוד כמו מודל שיחה רגיל ולא יפעיל את בלוקי החשיבה וההסקה העצמית שלו. כדי לנצל את יכולות הניתוח המעמיק שלו חובה להגדיר את תבנית המערכת המתאימה באפליקציה שבה אתם משתמשים.

איך מריצים

טוענים את קובץ ה־GGUF בתוכנות תומכות כמו LM Studio, SillyTavern, Koboldcpp או Ollama, וקובעים פרומפט מערכת ייעודי שמפעיל או מכבה את מנגנון החשיבה. לריצה על מעבד בלבד צריך לפחות 80 גיגה־בייט של זיכרון עבודה אם רוצים דיוק מלא, או קבצים קטנים בהרבה של 7 עד 13 גיגה־בייט לגרסאות הדיחוס הנמוכות, תוך השארת מרווח זיכרון להקשר.

אסור לפצל את המודל הזה בין מעבד לכרטיס מסך, כי מבנה המומחים יגרום לנפילה קשה בקצב היצירה. אם אין לכם כרטיס של 16 גיגה ומעלה או מעבד מהיר עם זיכרון DDR5 ברוחב פס גבוה, עדיף להשתמש ב־API מנוהל במקום להמתין דקות ארוכות לכל בלוק חשיבה.

ollama run hf.co/DavidAU/Qwen3-128k-30B-A3B-NEO-MAX-Imatrix-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. הוא מאפשר שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או בתוך מוצר ללקוחות, ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים המקורית, ציון השינויים שבוצעו וצירוף עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗