GPT
Q

Qwen3.6-14B-A3B-FableVibes-GGUF

קוד פתוח

tvall43apache-2.02026-06-14

  • gguf
  • qwen
  • llama.cpp
  • text-generation
  • vision

זיקוק של יכולות חשיבה ממודל ענק לתוך גודל שרץ על חומרה ביתית. הוא מציע פתרון בעיות בשלבים מרובים בלי להחזיק שרת יקר בענן.

  • 69.9 GBמשקל הקבצים
  • 402,866הורדות בחודש
  • 185לייקים

מה זה

הבסיס כאן עבר דיאטה אגרסיבית. לקחו דגם MoE מקורי וחתכו יותר מחצי מקיבולת המומחים שלו עד ל־14 מיליארד פרמטרים פעילים, ואז אימנו אותו ב־QLoRA באמצעות סוכן אוטונומי בשם סטיב כדי להחזיר לו את הכוח שאבד.

במקום אימון רגיל, הזריקו לו כ־4,600 עקבות חשיבה מורכבים מ־Claude Fable 5, לצד נתוני חשיבה מ־Claude Opus, דוגמאות קוד מ־Evol-Instruct-Code ושימוש בכלים מבית Qwen. התוצאה היא מודל רב תכליתי שיודע לחשוב צעד אחר צעד, ומגיע בגרסת GGUF שמתאימה לכלים כמו llama.cpp ו־Ollama, כולל קובצי mmproj לתמיכה בקלט ויזואלי.

מתאים ל

  • פתרון בעיות מורכבות מקומית

    מסלולי החשיבה של קלוד מאפשרים פירוק לוגי מדויק בשלבים על מחשב אישי.

  • הרצה עם כלי ראייה מקומיים

    קובצי mmproj המצורפים מאפשרים שילוב קלט תמונה לצד הסקת מסקנות מעמיקה.

  • כתיבת קוד וכלים באופליין

    אימון ה־LoRA כלל דוגמאות קוד וקריאה לכלים בסביבה מקומית ומבודדת.

איפה זה נופל

המודל פולט עשרות עד אלפי טוקנים של חשיבה לפני שהוא מתחיל לכתוב את התשובה הסופית, מה שאומר שהזמן לקבלת התו הראשון ארוך מאוד ולא יתאים למי שמחפש מהירות. בנוסף, חיתוך המומחים מהבסיס המקורי בוצע ישירות בלי אימון מקדים לפני החלת ה־LoRA, כך שחלק מהיכולות הכלליות של הדגם המקורי עלולות להישחק. שפת המודל המוצהרת היא אנגלית בלבד, ולכן לא כדאי להסתמך עליו למשימות בעברית.

שאלות
נפוצות

למה לוקח לו כל כך הרבה זמן להתחיל לענות?

הוא משתמש במנגנון חשיבה מובנה של Qwen ומייצר מאות או אלפי טוקנים של שיקול דעת פנימי לפני שהוא פולט את התו הראשון. צריך לתת לו תקציב טוקנים נדיב כדי שלא ייקטע באמצע.

האם הוא ירוץ על מחשב רגיל בלי כרטיס מסך מקצועי?

כן, גרסת Q4_K_M דורשת כ־8.4 ג'יגה בייט זיכרון בלבד. היא מיועדת לכרטיסי מסך ביתיים בטווח של 8 עד 12 ג'יגה בייט זיכרון וידאו דרך llama.cpp או Ollama.

איך מריצים

כדי להריץ אותו מקומית אפשר לבחור בין כמה גרסאות מכווצות. גרסת Q4_K_M שוקלת כ־8.4 ג'יגה בייט ומתאימה לכרטיסי מסך ביתיים עם 8 עד 12 ג'יגה בייט של זיכרון וידאו, בעוד שגרסאות דחוסות יותר כמו Q2_K יורדות לכ־5.3 ג'יגה בייט אך מאבדות איכות, ו־F16 מגיעה לכ־27 ג'יגה בייט.

אם אתם צריכים תשובות מיידיות בלי להמתין למאות טוקנים של שרשרת חשיבה, או שאין לכם כרטיס גרפי מתאים, עדיף להשתמש ב־API מנוהל של ספק ענן חיצוני.

ollama run hf.co/tvall43/Qwen3.6-14B-A3B-FableVibes-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים שלכם, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗