GPT
Q

Qwythos-27B-v1-GGUF

קוד פתוח

empero-aiapache-2.02026-07-14

  • gguf
  • llama.cpp
  • quantized
  • qwen3.5
  • reasoning

מודל מולטימודלי של 27 מיליארד פרמטרים עם ארכיטקטורה היברידית, תמיכה בתמונות והרחבת הקשר ענקית. הוא מציע שילוב של חשיבה עמוקה וקריאה לפונקציות בריצה מקומית.

  • 267 GBמשקל הקבצים
  • 336,680הורדות בחודש
  • 68לייקים

מה זה

מדובר בהמרה של מודל היברידי המבוסס על Qwen3.5-27B, שמשלב שכבות קשב מלא עם שכבות לינאריות מסוג Gated-DeltaNet ביחס של שלוש לאחת. ההמרה לפורמט GGUF שומרת על מודול הראייה המקורי ומגיעה עם ראש ייעודי לחיזוי מרובה טוקנים, שמאפשר האצה בזמן יצירת הטקסט. בניגוד להמרות רגילות שחותכות את הדיוק באופן גורף, כאן רכיבי המצב הקריטיים של הארכיטקטורה נשמרים בדיוק גבוה של 8 ביט או 32 ביט כדי למנוע קריסה באיכות הפלט.

הוא מיועד למשימות חשיבה מורכבות ומייצר בלוק של תהליך חשיבה פנימי לפני מתן התשובה, לצד תמיכה מובנית בהפעלת כלים ובקריאות לפונקציות. בכרטיס המודל אין מבחני ביצועים סטנדרטיים, אך יש בדיקה בודדת על כרטיס RTX 5090 שמראה קצב של כ־74 טוקנים לשנייה ביצירה וכ־622 טוקנים לשנייה בעיבוד הפרומפט בהקשר קצר.

מתאים ל

  • סוכן אוטונומי מקומי

    התמיכה המובנית בקריאה לפונקציות והרצת תהליכי חשיבה מתאימה למערכות שרצות בתוך הרשת הארגונית.

  • ניתוח מסמכים חזותיים

    מודול התמונה הנפרד מתחבר ישירות למודל ומאפשר לחלץ מידע ולהסיק מסקנות מקבצים גרפיים.

  • פיתוח עם תגובה מהירה

    גרסאות ה־MTP מאיצות את פליטת הטוקנים ומספקות חוויית שיחה שוטפת על כרטיס גרפי בודד.

איפה זה נופל

זהו צ'קפוינט ראשוני שעבר כוונון והתאמה אך עדיין לא עבר אימון בשיטת RL, כך שגרסה עתידית צפויה להתנהג אחרת. המפרסמים מודים במפורש שלא הריצו עליו מבחני ביצועים אקדמיים סטנדרטיים, ולכן אי אפשר לדעת מראש איך הוא יעמוד במשימות ספציפיות בלי שתבדקו אותו בעצמכם. בנוסף, מדובר במודל ללא מגבלות בטיחות או צנזורה פנימית, מה שמחייב אתכם לבנות מעטפת סינון ובקרה לפני שפותחים אותו למשתמשי קצה.

אותה משפחה

Qwythos יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו עם חלון של מיליון טוקנים על מחשב ביתי?

לא. החלון התיאורטי של מיליון טוקנים קיים בהגדרות, אבל זיכרון ה־KV הדרוש לאורך כזה יעבור בהרבה את מה שכרטיס בודד מסוגל להחזיק. בשביל הקשרים כאלה תצטרכו מערך מרובה כרטיסים או דחיפת רוב הזיכרון ל־RAM רגיל תוך ירידה קשה במהירות.

איזה קובץ להוריד מתוך כל הרשימה?

לרוב המשתמשים כדאי להתחיל עם Qwythos-27B-Q4_K_M.gguf יחד עם קובץ ה־mmproj לתמונות. אם אתם עובדים עם גרסה עדכנית של llama.cpp שכוללת תמיכה ב־MTP, עברו לגרסת MTP-Q4_K_M שמייצרת טקסט מהר יותר.

איך מריצים

כדי להריץ את גרסת ברירת המחדל, קובץ ה־Q4_K_M ששוקל 16.95 גיגהבייט, צריך כרטיס מסך עם לפחות 24 גיגהבייט זיכרון לעבודה בהקשרים קצרים. לקבלת קלט של תמונות חייבים לטעון במקביל גם את קובץ ה־mmproj ששוקל קרוב לגיגהבייט. אם אתם עולים לרמות דיוק כמו Q6_K או Q8_0, תצטרכו כרטיס של 48 גיגהבייט או פיצול הזיכרון למעבד, אחרת פשוט תיגמר לכם הקיבולת.

אם הכלי שלכם תומך בספקולציה דרך MTP, הגרסאות שמסומנות בתווית הזו מייצרות טקסט מהר יותר באותו נפח זיכרון כמעט. ברגע שתרצו לנצל הקשרים ארוכים באמת, זיכרון ה־KV יחנוק את החומרה המקומית, ושם עדיף לקחת שרת ייעודי או לפנות למודל מרוחק.

ollama run hf.co/empero-ai/Qwythos-27B-v1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המשקלים מופצים תחת רישיון Apache-2.0 שירשו ממודל הבסיס. מותר להשתמש בהם לצרכים מסחריים, לשנות אותם ולשלב אותם בקוד סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי, והם ניתנים כמות שהם ללא אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗