GPT
Q

Qwable-9B-Claude-Fable-5-GGUF

קוד פתוח

empero-aiapache-2.02026-06-15

  • gguf
  • llama.cpp
  • quantized
  • qwen3.5
  • multimodal

המודל מביא יכולות קוד, חשיבה וניתוח תמונה בגודל של תשעה מיליארד פרמטרים. הוא מיועד למי שמחפש סוכן טרמינל מקומי שרץ על חומרה צנועה יחסית.

  • 44.5 GBמשקל הקבצים
  • 10,355הורדות בחודש
  • 82לייקים

מה זה

מדובר באימון מלא של כל משקלי הטקסט על בסיס Qwen3.5-9B, תוך שימוש בדאטה סינתטי של עקבות חשיבה מקלוד ומסוכן טרמינל של GPT. המבנה משלב שכבות ליניאריות מסוג Gated DeltaNet עם תשומת לב מלאה, וכולל מקרן ראייה נפרד לניתוח תמונות שנשאר ללא שינוי מדגם הבסיס.

בבדיקה איכותית של 34 משימות, המודל סיפק תשובות נקיות ב־27 מתוכן. הוא נוטה לבחור כלים מודרניים של עבודה בלינוקס כמו פקודת ss במקום netstat הישנה, ולשלב שיקולי אבטחה בסיסיים כמו השוואת מחרוזות בזמן קבוע בעת כתיבת קוד.

מתאים ל

  • סוכן פקודות לטרמינל

    הוא הותאם לעבודה עם כלי לינוקס עדכניים ופקודות מערכת.

  • כתיבת קוד מקומית

    מייצר פונקציות וקוד מאובטח בלי לשלוח נתונים לענן.

  • ניתוח תמונות עם טקסט

    מאפשר עיבוד תמונות בשילוב קובץ הראייה הנפרד.

איפה זה נופל

כל תשובה נפתחת בבלוק חשיבה פנימי שצריך לחתוך בקוד לפני שמציגים אותה למשתמשי קצה, ויש צורך להגדיר עונש חזרתיות של 1.05 כדי למנוע לולאות חשיבה אינסופיות. המודל חלש יותר בידע כללי רחב מחוץ לתחומי התכנות והטרמינל, לא עבר אימוני בטיחות ייעודיים, והשפה העיקרית שלו היא אנגלית בלבד.

אותה משפחה

Qwable-9B-Claude-Fable-5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מציין אנגלית כשפה עיקרית בלבד. מודל הבסיס מבין מעט שפות נוספות, אך נתוני האימון הנוכחיים התמקדו בקוד ובטרמינל באנגלית ולא הייתי בונה עליו לעיבוד טקסט בעברית.

למה התשובה מתחילה בתגיות מוזרות?

זהו מודל חשיבה שפולט את תהליך ההסקה שלו בתוך תגיות ייעודיות. צריך לתפוס את הטקסט הזה בתוכנה שמריצה אותו, לנקות אותו, ורק אז להעביר את הפלט הסופי.

איך מריצים

הגרסה המומלצת לרוב השימושים היא Q4_K_M במשקל 5.3 גיגה-בייט, שדורשת בין 6 ל־8 גיגה-בייט זיכרון בכרטיס המסך. אם צריך ניתוח תמונות, מורידים בנוסף את קובץ ה־mmproj ששוקל 876 מגה-בייט ומריצים אותו דרך llama.cpp או Ollama עם דגל תואם.

גרסאות כמו Q6_K או Q8_0 שוקלות עד 8.9 גיגה-בייט ומציעות פחות פגיעה באיכות על חשבון צריכת זיכרון. אם אין לכם מעבד גרפי עם מספיק זיכרון פנוי, או שאתם לא צריכים שרשרת חשיבה מקומית, פנייה ל־API חיצוני תחסוך את כאב הראש.

ollama run hf.co/empero-ai/Qwable-9B-Claude-Fable-5-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המשקלים שוחררו תחת רישיון Apache-2.0 שמתיר שימוש מסחרי ושינויים בקוד. עם זאת, הנתונים אומנו על פלטים של מודלים קנייניים, ולכן תנאי השימוש של הספקים המקוריים עשויים להגביל שימוש מסחרי במוצר סופי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗