GPT
Q

Qwen3.5-27B-Claude-4.6-Opus-Distilled-MLX-4bit

קוד פתוח

mlx-communityapache-2.02026-03-04

  • mlx
  • safetensors
  • qwen3_5
  • reasoning
  • distilled

גרסה מכווצת של מודל בן 27 מיליארד פרמטרים שזוקק מדפוסי חשיבה של קלוד, מותאמת להרצה מקומית על מחשבי אפל סיליקון. מקבלים יכולת היסק עמוקה בלי להוציא שום דבר לענן.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 14.1 GBמשקל הקבצים
  • 6,599הורדות בחודש

מה זה

במקום לתת תשובה אינטואיטיבית מהירה כמו רוב המודלים הקטנים, המודל הזה מחזיק שלב חשיבה פנימי שבו הוא מפרק בעיות, בוחן כיווני פתרון ומתקן את עצמו לפני שהוא פולט מילה אחת. הוא מבוסס על משקלי Qwen 3.5 שעברו זיקוק מול מסלולי ההיסק של Claude 4.6 Opus, מה שמכוון אותו לצמצם חזרות מיותרות בלופים של שרשרת מחשבה.

המשקלים המקוריים שקלו 55.6 גיגה בייט, וההמרה לפורמט MLX בכימות של 4 ביט חתכה את הנפח ל־14 גיגה בייט בלבד. במבחן שנערך על מעבד M4 Pro עם 64 גיגה זיכרון, הוא קרא קלט בקצב של 86.5 טוקנים לשנייה וייצר פלט במהירות של 15.7 טוקנים לשנייה. אלה ביצועים סבירים מאוד לקריאה שוטפת, אבל לא מתאימים למי שצריך תגובות מיידיות בזמן אמת.

מתאים ל

  • תכנון ארכיטקטורת תוכנה

    פירוק משימות פיתוח מורכבות לשלבים לוגיים מסודרים מראש לפני קבלת ההחלטה הסופית.

  • פתרון בעיות היגיון

    שימוש במנגנון חשיבה מובנה שמבצע תיקון עצמי ובדיקת מסלולי פתרון לפני הצגת המענה.

  • ניתוח מסמכים מקומי

    עיבוד מידע רגיש באנגלית ישירות על המק בלי לשלוח שום דבר לשרתים חיצוניים.

איפה זה נופל

הקצב שלו איטי יחסית. 15.7 טוקנים לשנייה על חומרת M4 Pro אומר שתשובות ארוכות שדורשות חשיבה ממושכת יגרמו לכם לחכות. מעבר לזה, הכרטיס מציין תמיכה רק באנגלית ובסינית, כך שאין כאן הבטחה ליכולות היסק אמינות בעברית, וסביר להניח שהוא יגמגם או ייפול לטעויות שפה והיגיון אם תנסו לאתגר אותו בניסוחים מקומיים.

שאלות
נפוצות

האם המודל יכול לרוץ על מקבוק אייר עם 16 גיגה זיכרון?

לא. דרישת המינימום היא 24 גיגה בייט של זיכרון אחוד, ובבדיקות נמדדה צריכת שיא של 15.6 גיגה בייט רק עבור המודל עצמו. מחשב עם 16 גיגה פשוט יקרוס מחוסר זיכרון כשתנסו לטעון אותו.

איך אפשר לקבל רק את התשובה הסופית בלי כל שלב החשיבה?

אפשר לסנן את בלוק החשיבה מהטקסט בעזרת ביטוי רגולרי פשוט שמסיר את מה שנמצא בין תגיות החשיבה. אפשרות נוספת היא לכבות מראש את מצב החשיבה בהגדרות הקריאה כדי לקבל מענה ישיר ומהיר יותר.

איך מריצים

המודל רץ ישירות דרך ספריית mlx-lm בפייתון 3.10 ומעלה על גבי מערכת macOS 13.5 או גרסה חדשה יותר. אתם צריכים לפחות 24 גיגה בייט של זיכרון אחוד במק, אבל עדיף 32 גיגה בייט כדי שיישאר מרחב לעבודה עם הקשר ארוך ומורכב, במיוחד כשהשיא שנמדד בעבודה מעשית הגיע ל־15.6 גיגה בייט בזיכרון.

אפשר להפעיל אותו בצ'אט ישירות מהטרמינל או בקוד בעזרת תבנית השיחה שמפעילה את תגית החשיבה. אם אתם מחפשים רק שאילתות מהירות, עדיף לכבות את מנגנון החשיבה כדי לחסוך זמן, ואם אין לכם חומרה של אפל עם מספיק זיכרון, עדיף פשוט לקרוא ל־API חיצוני ולא לנסות להריץ אותו מקומית.

pip install -U huggingface_hub
hf download mlx-community/Qwen3.5-27B-Claude-4.6-Opus-Distilled-MLX-4bit

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים פנימיים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗