GPT
Q

Qwythos-9B-v2-GGUF

קוד פתוח

empero-aiapache-2.02026-07-09

  • gguf
  • llama.cpp
  • quantized
  • qwythos
  • qwen3.5

גרסת GGUF של מודל מבוסס Qwen3.5 עם חשיבה עמוקה, שמתאימה למי שרוצה חלון הקשר ענק של מיליון טוקנים והסקה מקומית בלי לולאות חזרתיות בטמפרטורה אפס.

  • 89.9 GBמשקל הקבצים
  • 636,661הורדות בחודש
  • 267לייקים

מה זה

זהו שחרור מכווץ של מודל 9B היברידי, המשלב שכבות ליניאריות של Gated-DeltaNet לצד תשומת לב רגילה. המודל פועל עם שרשרת חשיבה מובנית ופותח תשובות בבלוק ייעודי. הגרסה הזו פותרת בעיה קשה בגרסה הקודמת, שבה פענוח דטרמיניסטי או טמפרטורה נמוכה הובילו ללולאות טקסט אינסופיות. הירידה משיעור לולאות של 6.7% לאפס אחוז הושגה באמצעות כוונון עדין על טוקן הבסיס שמתחיל את החזרה, כך שאין צורך עוד בקנסות חזרתיות מלאכותיים בזמן הריצה.

בנוסף שוחזר ראש חיזוי הטוקנים המקבילי, שמאפשר דגימה ספקולטיבית מהירה יותר בתוכנות תומכות. מכיוון שמדובר בארכיטקטורה היברידית, שכבות המצב הרגישות נשמרו בדיוק גבוה יותר גם בקבצים המכווצים, כדי למנוע הידרדרות של ממש בביצועי ההיגיון והידע ביחס למודל המקורי.

מתאים ל

  • הסקה דטרמיניסטית מקומית

    מאפשר ריצה בטמפרטורה אפס לפתרון בעיות היגיון בלי ליפול ללולאות טקסט אינסופיות.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר עצום של עד מיליון טוקנים שמתאים לעיבוד טקסטים ארוכים במיוחד.

  • שרת הסקה מואץ

    כולל קבצים מותאמים עם ראש MTP לדגימה ספקולטיבית שמקצרת את זמן יצירת הטקסט.

איפה זה נופל

כל תהליך האימון של המודל נעשה על טקסט בלבד באנגלית, ללא אימון על שפה אחרת כמו עברית. רכיב הראייה נשאר קפוא ולא עבר שום התאמה או הערכה עצמאית בגרסה זו, כך שהבנת תמונות לא נהנית מהשיפורים של מודל ההיגיון. בנוסף המודל אינו מצונזר בהגדרה ודורש בדיקה קפדנית אם אתם מייעדים אותו ללקוחות קצה.

אותה משפחה

Qwythos יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל לעיבוד תמונות?

כן, אבל צריך להוריד בנפרד את קובץ הראייה mmproj ולהריץ אותו במצב מולטימודלי. עם זאת, רכיב התמונות לא עבר כוונון בגרסה הזו והיכולות שלו זהות לדגם המקורי.

איזה קובץ לבחור אם רק מתחילים?

עדיף להוריד את קובץ Q4_K_M הרגיל ששוקל 5.74 גיגהבייט. הוא מאזן בין צריכת זיכרון נמוכה לאיכות פלט, ומתאים לרוב מנועי ההרצה הקיימים בלי לדרוש תמיכה בחיזוי מקבילי.

איך מריצים

משקלי הריצה מתאימים לכלים כמו llama.cpp או Ollama. הקובץ המומלץ Q4_K_M שוקל כחמישה וחצי גיגהבייט ויכול לרוץ בנוחות על כרטיס מסך ביתי עם שמונה עד שנים עשר גיגהבייט זיכרון גרפי, כל עוד חלון ההקשר קצר יחסית. קיימות שתי משפחות קבצים עיקריות, רגילות וגרסאות עם רכיב MTP שמאפשרות האצת יצירה בגרסאות llama.cpp עדכניות.

אם אתם מתכננים לנצל את מלוא חלון ההקשר שמגיע למיליון טוקנים, תצטרכו חומרת שרתים כמו H100 או מספר כרטיסים גרפיים במקביל עבור זיכרון ה־KV. בתרחיש כזה, או אם אין לכם כרטיס חזק פנוי, עדיף להשתמש בספק שירות חיצוני מאשר לנסות לנהל את זיכרון ההקשר המלא בעצמכם.

ollama run hf.co/empero-ai/Qwythos-9B-v2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗