GPT
Q

Qwythos-9B-Claude-Mythos-5-1M-GGUF

קוד פתוח

empero-aiapache-2.02026-06-19

  • gguf
  • llama.cpp
  • quantized
  • qwen3.5
  • reasoning

גרסת GGUF למודל חשיבה מבוסס קוד פתוח עם חלון של מיליון טוקנים. הוא פונה למי שמחפש יכולות היסק ושימוש בכלים בחומרה מקומית, בלי צנזורה על נושאים טכניים.

  • 89.6 GBמשקל הקבצים
  • 550,828הורדות בחודש
  • 2,707לייקים

מה זה

מדובר בהתאמה של Qwen3.5-9B שעברה אימון המשך על שרשראות חשיבה סינתטיות. המודל מפיק בלוק חשיבה מובנה לפני כל תשובה, תומך בקריאות לפונקציות לפי הפורמט של מודל הבסיס, ומגיע עם הרחבת הקשר למיליון טוקנים באמצעות מנגנון YaRN. הוא כולל גם תמיכה בקלט תמונה דרך קובץ מקרן נפרד.

במדדי ההערכה מול מודל הבסיס הוא מציג זינוק של 34 נקודות ב־MMLU ו־30 נקודות ב־gsm8k במדידה מחמירה. המשמעות בפועל היא יכולת טובה משמעותית בפתרון בעיות היגיון, מתמטיקה ומענה רב-שלבי, תחומים שבהם מודלים קטנים בדרך כלל מתקשים בלי שרשרת חשיבה מפורטת.

מתאים ל

  • חשיבה טכנית ומחקר אבטחה

    הוא אינו מצונזר ומתמודד עם שאלות מורכבות בקוד, חולשות וסייבר בלי לסרב.

  • סוכנים מבוססי פונקציות

    הוא מייצר קריאות כלים תקינות ויודע לתקן את עצמו באמצעות הרצת פקודות וחיפוש.

  • עיבוד מסמכים טכניים ותמונות

    שילוב מקרן התמונה מאפשר חילוץ נתונים מטבלאות ותרשימים ישירות לסביבה מקומית.

איפה זה נופל

האימון נעשה על טקסט בלבד, כך שיכולות הראייה נשארו בדיוק כמו במודל הבסיס ולא נבדקו עצמאית. המודל פועל ללא צנזורה, מה שמחייב אתכם לבנות שכבת הגנה באפליקציה לפני חשיפה למשתמשי קצה.

בנוסף, הוא נוטה להינעל לפעמים על מזהים טכניים ספציפיים כמו מספרי חולשות אבטחה שאינו בטוח לגביהם, ולכן מחייב אימות מול מאגר חיצוני. דגימה בטמפרטורה נמוכה מדי גורמת לו להיכנס ללולאות של חזרתיות, ויש לקחת בחשבון שבלוק החשיבה דורש הקצאה של אלפי טוקנים נוספים לכל פלט.

אותה משפחה

Qwythos-9B-Claude-Mythos-5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לעבד תמונות בעצמו?

המודל כולל קובץ מקרן נפרד בנפח של פחות מגיגה-בייט שמתחבר לטקסט. עם זאת, רכיב הראייה הוקפא במהלך האימון ולא שודרג, כך שביצועי התמונה זהים לחלוטין לאלה של Qwen3.5-9B המקורי.

איך מונעים מהמודל להחזיר תשובות שבורות?

הכרטיס מדגיש שחובה להשתמש בטמפרטורה סביב 0.6 ולא לרדת לערכים נמוכים כמו 0.3 או פענוח חמדן שגורמים ללולאות חזרתיות. כמו כן יש להגדיר תקציב פלט גבוה של עד 16384 טוקנים כדי לתת מקום לתהליך החשיבה.

האם המודל מדבר עברית?

המודל אומן והוגדר רשמית עבור השפה האנגלית בלבד. אף על פי שמודל הבסיס מציג תמיכה מסוימת בשפות נוספות, אימון ההיסק הנוכחי התמקד באנגלית ולכן לא הייתי בונה עליו לעיבוד עברית מורכב.

איך מריצים

ההרצה נעשית באמצעות llama.cpp, Ollama או LM Studio. גרסת Q4_K_M שוקלת 5.63 גיגה-בייט ונכנסת בקלות לכרטיס מסך בודד עם 8 או 12 גיגה-בייט של זיכרון, יחד עם קובץ התמונה שדורש עוד כגיגה-בייט אחד. קיימות גם גרסאות MTP שתומכות בהאצת יצירה מול גרסאות תואמות של llama.cpp.

אם אתם מתכננים לנצל את מלוא מיליון הטוקנים בהקשר, זיכרון ה־KV יחנוק כרטיס ביתי וידרוש שרתי H100 או חלוקת זיכרון מתקדמת. במקרים של הקשרים ענקיים כאלה, עדיף להשתמש בתשתיות ענן או שירותי מודלים ייעודיים במקום לנסות לדחוף את זה למחשב מקומי.

ollama run hf.co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, להטמיע במוצרים סגורים, לשנות את הקוד ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗