GPT
Q

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-GGUF

קוד פתוח

Jackrongapache-2.02026-02-27

  • transformers
  • gguf
  • qwen3_5
  • image-text-to-text
  • llama.cpp

התאמה אישית של מודל קוד פתוח עם זיקוק תהליכי חשיבה מבוססי קלוד. מתאים למי שבונה סוכני קוד מקומיים וצריך פעולה יציבה בלי קריסות של תבניות שיחה.

  • 262,144טוקנים בהקשר
  • 55.3 GBמשקל הקבצים
  • 37,134הורדות בחודש
  • 679לייקים

מה זה

מדובר בכוונון עדין על בסיס Qwen3.5 בגודל 27 מיליארד פרמטרים, שעבר אימון עם Unsloth על שרשראות חשיבה מתוך Claude-4.6 Opus. האימון התמקד במבנה חשיבה מסודר בתוך תגיות ייעודיות לפני הפלט הסופי, כדי למנוע לולאות חשיבה מיותרות וחוזרות שמאפיינות לעיתים את מודל הבסיס.

בדיקות של הקהילה מראות יתרון בולט בסביבות עבודה של סוכני פיתוח כמו Claude Code או OpenCode. בעוד מודל הבסיס נוטה להיתקע בריצות ארוכות, הגרסה הזו מסוגלת לרוץ באופן עצמאי מעל תשע דקות ברצף, לקרוא פלטים מכלי מערכת ולתקן שגיאות לבד. השינוי פותר גם בעיית קריסה ידועה של תבנית השיחה הרשמית עם תפקיד המפתח.

מתאים ל

  • סוכני תכנות מקומיים

    כולל תמיכה מובנית בתפקיד מפתח ואינו נתקע בקריאות חוזרות לכלי מערכת.

  • פתרון בעיות לוגיות

    מייצר תוכנית עבודה סדורה שלב אחר שלב בתוך תגיות חשיבה סגורות.

  • אוטומציה עצמאית

    מסוגל לפעול דקות ארוכות ברצף ללא התערבות אנושית לצורך תיקון קוד.

איפה זה נופל

היוצר מגדיר את ההפצה כגרסת תצוגה מקדימה, מה שאומר שסביבת הכלים, תבניות ההסקה והאינטגרציות עוד לא מיוצבות לגמרי ועלולות להכיל באגים. בנוסף, למרות החשיבה המובנית, קיימת סכנת הזיות בעובדות מציאותיות, והאימון הנוכחי מכסה רק טקסט באנגלית ובסינית ללא תמיכה מוצהרת בעברית.

אותה משפחה

Qwen3.5-27B-Claude-4.6-Opus-Reasoning יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

השפות שמוגדרות רשמית הן אנגלית וסינית בלבד. אם תפנו אליו בעברית תקבלו תוצאות פחות יציבות, ולכן הוא לא מיועד למשימות בשפה המקומית.

האם אפשר להריץ אותו על כרטיס מסך ביתי יחיד?

כן, בגרסה מכומתת של ארבעה ביטים הוא צורך כ־16.5 גיגה בייט זיכרון גרפי, כך שכרטיס של 24 גיגה כמו RTX 3090 מריץ אותו בלי בעיה.

איך מריצים

משקל הקבצים המלא בפורמט bfloat16 מגיע ל־55.3 גיגה בייט, מה שמחייב חומרה כבדה מאוד להרצה ללא דחיסה. עם זאת, בכימות מסוג Q4_K_M הוא דורש כ־16.5 גיגה בייט זיכרון כרטיס מסך, מה שמאפשר להריץ אותו מקומית על כרטיס בודד כמו RTX 3090 במהירות של 29 עד 35 טוקנים לשנייה.

אם אין לכם כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון פנוי, או שאתם לא צריכים שרשראות חשיבה ארוכות של סוכנים מקומיים, עדיף להשתמש ב־API מנוהל של מודלים סגורים.

ollama run hf.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

7 קבצים במאגר, 55.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗