GPT
Q

Qwen3.6-27B-MTPLX-Optimized-Speed

קוד פתוח

Youssofalapache-2.02026-05-03

  • mlx
  • safetensors
  • qwen3_5
  • apple-silicon
  • speculative-decoding

גרסה מכווצת של מודל 27 מיליארד פרמטרים שמיועדת למחשבי מק. היא משתמשת בריצה מקבילית מובנית כדי להאיץ כתיבת טקסט וקוד.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 4,925הורדות בחודש

מה זה

הגרסה הזו לוקחת את מודל הבסיס של קוון ומארגנת אותו מחדש בפורמט ארבע ביט שמתאים ישירות לספריית MLX של אפל. הייחוד כאן הוא ניצול ראשי החיזוי הפנימיים של המודל באמצעות מנוע ייעודי, מה שמאפשר לו לחזות כמה טוקנים במקביל במקום אחד בכל פעם, בלי מודל עזר חיצוני שמבזבז זיכרון נוסף.

בבדיקות הביצועים שפורסמו על שבב אפל מסוג M5 Max, המבנה הזה סיפק קצב יציב של סביב שישים ושלושה טוקנים לשנייה במשימות קוד. ההאצה הזו נמדדה בתנאי דגימה רגילים ולא רק בהרצה נוקשה, כשהיא שומרת על דיוק התוצאה הסופית ביחס למודל המקורי.

מתאים ל

  • השלמת קוד מקומית במק

    מייצר קוד במהירות של מעל שישים טוקנים לשנייה במחשבי אפל חזקים בלי לשלוח מידע החוצה.

  • שרת פיתוח פנימי לצוות

    הכלי מציע פקודת שרת מובנית להרצה מקומית ומאפשר לחבר עורכי קוד דרך כתובת רשת פנימית.

  • בדיקת ממשקי שפה ואוטומציה

    מתאים לעבודה שוטפת מול חלון טקסט רחב בלי לשלם עלויות לפי קריאה לספק חיצוני.

איפה זה נופל

המגבלה המרכזית היא תלות מוחלטת בסביבת אפל ובגרסת תוכנה נסיונית בשם mtplx שנמצאת בשלבי פיתוח ראשוניים. בנוסף, המספרים המרשימים הושגו כשרכיב הניתוח המעמיק, מצב החשיבה, כבוי לחלוטין ובעומס עבודה נמוך מאוד על המחשב. הכרטיס מיועד לפעולה רק מול סוג מסוים של ארכיטקטורת תחזית, כך ששינוי בהגדרות הדגימה או הפעלת חשיבה מורכבת עלולים להוריד את קצב הייצור ולבטל את היתרון שבגללו לקחתם אותו.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי עם כרטיס RTX של אנבידיה?

לא. הקבצים והמשקלים עברו התאמה ייעודית למנוע MLX שמיועד למעבדי אפל בלבד. למחשבי פיסי רגילים תצטרכו להוריד את גרסאות המודל הרגילות בפורמטים כמו GGUF.

איזה מחשב מק מינימלי צריך בשביל שהמודל יעבוד בצורה שמישה?

הקבצים עצמם תופסים כחמישה עשר גיגה, אבל כדי לנצל את מלוא ההקשר ולהריץ את שכבות החיזוי נדרש זיכרון מאוחד גדול. בדיקות הביצועים הרשמיות נערכו על מעבד מקס עם 128 גיגה זיכרון, כך שדגמים בעלי פחות משלושים ושניים גיגה יתקשו לתפקד.

איך מריצים

המודל הזה נבנה בלעדית עבור מק עם מעבדי אפל סיליקון, ומריצים אותו באמצעות כלי שנקרא mtplx דרך שורת הפקודה או בהתקנה מגיטהאב. הוא דורש חומרה חזקה, כאשר בדיקות היצרן הרשמיות בוצעו על מחשב עם 128 גיגה זיכרון מאוחד, כך שמחשבי מק בסיסיים עם שמונה או שישה עשר גיגה זיכרון ייכשלו בהרצה שלו.

אם אתם עובדים על שרתי לינוקס או מחשבי חלונות עם כרטיסי אנבידיה, אין לכם מה להוריד את הקבצים האלה. במקרה שאין לכם מק ייעודי וחזק לפיתוח מקומי, עדיף להשתמש בממשק רשת חיצוני שמגיש את המודל המקורי.

pip install -U huggingface_hub
hf download Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed

הרישיון

הרישיון הוא אפאצ׳י 2.0 מלא, גם עבור מודל הבסיס וגם עבור שכבת ההמרה. מותר להשתמש בו ליישומים מסחריים, לשנות אותו, להריץ אותו בארגון ולשלב אותו במוצרים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗