GPT
Q

Qwen3-4B-Qwen3.6-plus-Reasoning-Distilled-GGUF

קוד פתוח

khazaraiapache-2.02026-04-06

  • gguf
  • qwen3
  • llama.cpp
  • unsloth
  • text-generation

זיקוק חשיבה ממודל ענק לתוך 4 מיליארד פרמטרים שרץ מקומית. הוא פותר בעיות מורכבות בצורה מובנית במקום להתברבר במחשבות ארוכות.

  • 262,144טוקנים בהקשר
  • 9.5 GBמשקל הקבצים
  • 3,385הורדות בחודש
  • 52לייקים

מה זה

מדובר בגרסת GGUF שעברה כיוונון עדין על גבי מודל הבסיס באמצעות דאטהסט שחולץ מהמודל הגדול יותר. במקום שהמודל ידבר עם עצמו, יתלבט בקול ויבזבז טוקנים על שרשראות מחשבה אינסופיות, תהליך הזיקוק כיוון אותו לפלוט ישירות ניתוח מובנה, תוכנית פעולה וקוד.

במבחן ביצועים פנימי של 100 שאלות חשיבה מרובות תחומים, הוא הוציא ציון של 75.64 לעומת 73.73 של מודל המקור. הפער במספרים לא ענק, אבל ההבדל מורגש בצורת התשובה, הוא ניגש ישר לאלגוריתם ולניתוח סיבוכיות בלי ללכת לאיבוד בלולאות של תיקון עצמי.

מתאים ל

  • פתרון בעיות אלגוריתמיות

    הוא מפרק בעיות גרפים ומבני נתונים ישירות לניתוח, אלגוריתם וקוד נקי בלי לכתוב יומן מחשבות.

  • סוכן בדיקות מקומי בקוד

    גודל של כמה גיגה בייטים בודדים מאפשר לשלב אותו בסביבת פיתוח מנותקת כדי לחלץ ניתוחי סיבוכיות.

  • עיבוד משימות לוגיות במכשיר

    דרישות חומרה נמוכות מאפשרות להריץ תהליכי חשיבה מובנים ישירות על חומרת קצה בלי תלות ברשת.

איפה זה נופל

המודל אומן על אנגלית בלבד לפי המפרט, כך שאם אתם בונים על עבודה בעברית תצטרכו לבדוק אותו בזהירות או לוותר מראש. בנוסף, מבחן הביצועים שנמסר מבוסס על 100 שאלות בלבד של יוצר המודל, מדגם קטן מאוד שלא מבטיח עמידות בכל תרחיש. הוא אולי חותך את הדיבור העצמי, אבל מתחת נשאר מודל קטן של 4 מיליארד פרמטרים שעלול לטעות בעובדות קשות.

שאלות
נפוצות

איזו גרסת כימות כדאי להוריד למחשב פיתוח רגיל?

גרסת Q6_K ששוקלת 3.3 גיגה בייט מציעה איכות טובה בלי לתפוס הרבה משאבים. אם יש לכם מספיק זיכרון בכרטיס המסך, גרסת Q8_0 ששוקלת 4.2 גיגה בייט תיתן את המקסימום.

האם הוא יודע לעבוד בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. מודלים מסדרת קוון כוללים לפעמים יכולת בסיסית בשפות נוספות, אבל לא הייתי בונה עליו למשימות חשיבה בעברית בלי לבדוק אותו קודם.

איך מריצים

הקבצים מגיעים בכמה רמות כימות, החל מגרסת 2.3 גיגה בייט בכימות מופחת ועד 4.2 גיגה בייט לגרסה האיכותית יותר, לצד קובץ מלא של 8 גיגה בייט. גרסת הקידוד המאוזנת תופסת סביב 3.3 גיגה בייט ותרוץ חלק על כמעט כל כרטיס מסך ביתי או מחשב נייד עם מעבד מודרני בלי לחנוק את הזיכרון.

אם אתם צריכים רק מדי פעם תשובה לבעיה מורכבת, אין טעם להוריד שום דבר ועדיף לשלוח קריאה לענן. ההרצה המקומית הגיונית כשאתם בונים תהליך אוטומטי שדורש פלט הנדסי יציב ושמירה על מידע מקומי.

ollama run hf.co/khazarai/Qwen3-4B-Qwen3.6-plus-Reasoning-Distilled-GGUF:Q6_K

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗