GPT
Q

Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-GGUF

קוד פתוח

Jackrongapache-2.02026-03-03

  • gguf
  • qwen3_5
  • unsloth
  • qwen
  • qwen3.5

זיקוק חשיבה של קלוד אופוס לתוך ארכיטקטורה קומפקטית של ארבעה מיליארד פרמטרים. פתרון ממוקד למי שרוצה חשיבה מובנית בשלבים בהרצה עצמית זולה.

  • 262,144טוקנים בהקשר
  • 26.5 GBמשקל הקבצים
  • 396,354הורדות בחודש
  • 159לייקים

מה זה

מדובר בכוונון של מודל הבסיס Qwen3.5-4B באמצעות למידה ממוקדת של שרשראות חשיבה מקלוד 4.6 אופוס ותוספת מודל 27B. המודל מתמקד בכתיבת תהליך חשיבה פנימי בתוך תגיות think לפני שהוא פולט תשובה, במקום להיכנס ללולאות מחשבה חוזרות ומיותרות שמאפיינות לעיתים מודלים קטנים.

במדדי ההערכה הרשמיים שנבדקו בקוונטיזציה של שמונה ביט, השינוי מציג שיפור נקודתי. במבחן GPQA Diamond המודל עלה מציון של 33.82 במודל הבסיס ל־38.88, ובמבחן ARC-Challenge עלה מ־64.59 ל־66.38. אלו לא תוצאות של מודלי ענק, אבל הן מראות יכולת ניתוח טובה יותר של שאלות מורכבות ביחס לגודל שלו.

מתאים ל

  • פתרון בעיות מתמטיקה

    פירוק מובנה של שלבי חישוב בתגיות חשיבה סגורות לפני מתן הפתרון.

  • ניתוח לוגי אופליין

    הרצה מקומית של שאלות היגיון ללא תשלום על טוקנים וללא תלות ברשת.

  • חקירת תהליכי זיקוק

    בדיקה מעשית של השפעת נתוני חשיבה מקלוד על מודלים קטנים של 4B.

איפה זה נופל

הכרטיס מבהיר במפורש שהמודל מיועד ללמידה, מחקר וחקירה טכנולוגית בלבד, ולא למוצר סופי. בנוסף, יש סכנה ברורה להזיות בתוך שלבי החשיבה עצמם בכל הנוגע לעובדות מהעולם האמיתי. השפות המוגדרות במודל הן אנגלית, סינית וקוריאנית בלבד, כך שעברית לא נתמכת כאן באופן רשמי ולא כדאי לבנות עליה. המודל אומן עם חלון הקשר של 16,384 טוקנים בתהליך הכוונון, למרות נתוני ארכיטקטורת הבסיס.

אותה משפחה

Qwen3.5-4B-Claude-4.6-Opus-Reasoning יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

השפות המדווחות במודל הן אנגלית, סינית וקוריאנית. לא בוצע כאן אימון מכוון בעברית, ולכן פלט בעברית עלול להיות משובש או לא יציב.

כמה זיכרון דרוש כדי להריץ אותו?

מדובר במודל של ארבעה מיליארד פרמטרים שרץ בפורמט GGUF. בקוונטיזציה ממוצעת תוכלו להריץ אותו בקלות על כרטיס מסך ביתי צנוע עם שמונה ג'יגה זיכרון או ישירות על גבי מעבד וזיכרון RAM רגיל.

האם כדאי לשלב אותו במערכת ייצור?

לא מומלץ כרגע. היוצר הגדיר אותו כגרסת בדיקה למחקר ולמידה בלבד, והוא נוטה להזיות בעובדות מציאותיות בתוך שלבי ההסקה.

איך מריצים

המודל מגיע בפורמט GGUF, מה שאומר שאפשר לטעון אותו ישירות בכלים מקומיים כמו llama.cpp על מעבד רגיל או מאיץ גרפי ביתי. קובצי המשקל במאגר שוקלים יחד 26.5 ג'יגה־בייט ומחולקים לכמה קבצים, כך שצריך לבחור את רמת הקוונטיזציה המתאימה לנפח הזיכרון שיש לכם בכרטיס או במחשב.

אם אתם צריכים רק שאילתות בודדות או דיוק עובדתי מוחלט, עדיף פשוט לפנות ישירות ל־API של מודל מסחרי גדול. הרצה מקומית של המודל הזה מתאימה כשאתם מריצים המון ניתוחים אופליין ולא רוצים לשלם על כל טוקן שרץ בתהליך החשיבה.

ollama run hf.co/Jackrong/Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש חופשי, שינוי קוד והפצה. עם זאת, היוצר מציין בכרטיס שהגרסה מיועדת למחקר והדגמה בלבד, כך שקיים פער בין הרישיון היבש להגדרת השימוש המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗