GPT
Q

Qwen3.5-0.8B-Claude-4.6-Opus-Reasoning-Distilled-GGUF

קוד פתוח

Jackrongapache-2.02026-03-05

  • gguf
  • qwen3_5
  • unsloth
  • qwen
  • qwen3.5

שילוב נדיר בין מודל בסיס זעיר של שמונה מאות מיליון פרמטרים לתהליך חשיבה מובנה של קלוד. פתרון ממוקד להרצה מקומית של הסקת מסקנות בלי לתפוס זיכרון עבודה.

  • 262,144טוקנים בהקשר
  • 5.2 GBמשקל הקבצים
  • 6,069הורדות בחודש
  • 86לייקים

מה זה

מדובר בכיוונון עדין למודל הקטן של קוון, שעבר אימון על דאטה־סט מזוקק שמכיל 2,516 דוגמאות של מסלולי חשיבה מקלוד. המטרה כאן היא ללמד מודל זעיר לעצור, לתכנן צעדים בתוך תגיות ייעודיות, ורק אז לפלוט פלט סופי, במקום לירות תשובות מהירות או להיתקע בלולאות חשיבה אינסופיות שאופייניות למודלי בסיס.

האימון התמקד במבנה לוגי מוגדר מראש שבוחן אילוצי בעיה ומחלק אותה לחלקים. בניגוד לרוב המודלים בגודל הזה, שמיועדים בעיקר להשלמת טקסט בסיסית וכושלים בלוגיקה רב־שלבית, כאן יש ניסיון לחקות מודל ענק ברמת הפירוק הלוגי, גם אם הידע הכללי נשאר מוגבל לנפח המקורי.

מתאים ל

  • פירוק בעיות קוד מקומי

    מייצר שלבי פתרון מובנים צעד אחר צעד על גבי חומרה חלשה בלי תלות ברשת.

  • ניתוח לוגיקה במכשיר קצה

    רץ ישירות על מעבד מקומי לצורך הסקת מסקנות מתמטית על קלטים קצרים.

  • הדגמת תהליכי הסקה

    מאפשר לבחון אימון על תגיות חשיבה בלי להשקיע במשאבי מחשוב כבדים.

איפה זה נופל

הכרטיס מצהיר בפירוש שמדובר בגרסת בדיקה למטרות מחקר והדגמה בלבד, ולא במודל לייצור. הסכנה העיקרית פה היא הזיות, מודל בגודל הזה מייצר לפעמים עובדות שגויות בתוך בלוק החשיבה שלו וממשיך לבסס עליהן את הפתרון. בנוסף, הוא אומן על אנגלית, סינית וקוריאנית, כך שעברית כלל אינה ברשימת השפות הנתמכות ולא כדאי להסתמך עליו בניתוח טקסט מקומי.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הכרטיס מציין תמיכה באנגלית, סינית וקוריאנית בלבד. הוא עשוי לפלוט מילים בעברית עקב מודל הבסיס, אך שרשראות החשיבה והאימון הלוגי לא כוונו לשפה זו ואיכות הפלט תהיה נמוכה.

האם כדאי לשלב אותו במערכת פעילה ללקוחות?

לא מומלץ. מעבר להצהרת המפתח שמדובר בגרסת ניסוי למחקר, מודלים בגודל שמונה מאות מיליון פרמטרים סובלים מהזיות תכופות בעובדות ואינם יציבים מספיק לשמש מענה ישיר למשתמשי קצה.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.2 גיגה־בייט בפורמט מותאם לזיכרון קטן, מה שאומר שאפשר להריץ אותו ישירות על מעבד של מחשב נייד ישן או מעבד גרפי צנוע מאוד בלי שום מאמץ. אין צורך בשרת ייעודי או בכרטיסי מסך יקרים כדי לראות ביצועים שוטפים.

אם אתם צריכים רק פתרון מהיר של שאלות היגיון נקודתיות בלי לשלוח מידע החוצה, הרצה עצמית כזו סוגרת את הפינה בחינם. לעומת זאת, אם המשימה שלכם כוללת שליפת עובדות עדכניות, ידע רחב בעברית או עבודה עם מסמכים ארוכים באמת, עדיף לפנות ישירות לשרת מרוחק של מודל גדול בהרבה.

ollama run hf.co/Jackrong/Qwen3.5-0.8B-Claude-4.6-Opus-Reasoning-Distilled-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0 המאפשר שימוש חופשי, שינוי והפצה, כולל שילוב במוצרים מסחריים בלי תשלום תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. עם זאת, היוצר מציין בכרטיס שהגרסה נועדה למחקר בלבד, מה שיוצר סתירה בין הרישיון המשפטי לכוונת המפתח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗