GPT
Q

Qwen3.5-14B-A3B-Claude-4.6-Opus-Reasoning-Distilled-reap-gguf

קוד פתוח

tvall43apache-2.02026-03-09

  • transformers
  • gguf
  • text-generation-inference
  • unsloth
  • qwen3_5_moe

ניסיון לדחוס חשיבה מובנית של קלוד לתוך מודל קטן יחסית. מתאים למי שרוצה הסברים מפורטים בתוך תגיות חשיבה בלי לשלם על שירות ענן.

  • 35.2 GBמשקל הקבצים
  • 2,896הורדות בחודש
  • 47לייקים

מה זה

מדובר בגרסה שעברה כיוונון עם לורה מעל בסיס של קוון, תוך שימוש בתשובות מזוקקות שמחקות את סגנון ההסבר של קלוד. המטרה כאן היא לייצר שלבי עבודה מסודרים מראש, במקום מלל שחוזר על עצמו במעגלים.

בפועל, המודל מחלק את הפתרון לשלבים ממוספרים בתוך תגית ייעודית לפני שהוא פולט את התשובה הסופית. המפתח ניסה לדחוס אותו באמצעות שילוב דחיסה של 0.65 כדי לבדוק התאמה לכרטיסי מסך ביתיים, אבל מבחני השטח שהציג מראים ביצועים מעורבים מאוד, כמו כישלון מלא בבניית משחק סנייק פשוט אפילו אחרי שמונה ניסיונות.

מתאים ל

  • פירוק משימות אנליטיות

    הוא מתוכנן לתת שרשרת חשיבה מובנית בתוך תגיות ייעודיות לפני הפלט.

  • ניתוח לוגי באופליין

    מתאים למי שרוצה לבחון תהליכי הסקה בלי להוציא נתונים לרשת חיצונית.

  • בדיקת דחיסת מודלים

    מאפשר לבחון איך התנהגות המודל מושפעת מיחס דחיסה של 0.65 בפועל.

איפה זה נופל

המודל מוגדר מראש כגרסת תצוגה מוקדמת ולא יציבה. במבחן המעשי שלו הוא נכשל לחלוטין ביצירת קובץ קוד בודד למשחק בסיסי, מה שמראה שהיכולת שלו לייצר קוד עובד מוגבלת מאוד כרגע. מעבר לזה, הכרטיס מציין במפורש סכנת הזיות בעובדות מציאותיות בזמן החשיבה, ורשימת השפות הנתמכת רשמית כוללת אנגלית, סינית וקוריאנית בלבד בלי שום הבטחה לגבי עברית.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

התיעוד הרשמי מציין תמיכה באנגלית, סינית וקוריאנית בלבד. עברית לא נבדקה ולא הוגדרה ביעדי האימון, ולכן לא מומלץ להסתמך עליו למשימות בשפה הזו.

האם כדאי לשלב אותו במערכת ייצור כרגע?

הכרטיס מצהיר בגלוי שמדובר בגרסת בדיקה לא בשלה עם בעיות תאימות אפשריות. הכישלון שלו במבחני קוד פשוטים מעיד שהוא עדיין לא מתאים ליישומים יציבים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־35.2 גיגה בייט בחמישה קבצים, כך שצריך כרטיס גרפי רציני או חלוקה בין זיכרון המערכת לכרטיס כדי לטעון אותו מקומית. המפתח עצמו בדק אותו על כרטיס עם זיכרון גדול לאחר שחישוב הזיכרון המקורי שלו התפספס.

אם אין לכם חומרה ייעודית מתאימה, עדיף בהחלט לפנות למודל מקורי דרך שירות ענן. הרצה מקומית של קבצים בגודל הזה בלי תמיכה מלאה בחומרה תגרור זמני תגובה איטיים מאוד שלא יתאימו לשום שימוש שוטף.

ollama run hf.co/tvall43/Qwen3.5-14B-A3B-Claude-4.6-Opus-Reasoning-Distilled-reap-gguf:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא אפאצ׳י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל כחלק ממוצר, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗