GPT
Q

Qwen3.5-4B-MLX-4bit

קוד פתוח

mlx-communityapache-2.02026-03-02

  • mlx
  • safetensors
  • qwen3_5
  • qwen3.5
  • vision-language-model

גרסה מכווצת בארבעה ביטים של מודל ראייה ושפה מבית עליבאבא, מותאמת ישירות למעבדי אפל סיליקון. היא שוקלת פחות משלושה גיגהבייט ויודעת לנתח תמונות לצד טקסט מקומי.

  • 4.5Bפרמטרים
  • 262,144טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 25,341הורדות בחודש

מה זה

מדובר בהמרה מקומית של מודל רב מודאלי עם 4.5 מיליארד פרמטרים, שנועדה לרוץ ישירות על מעבדי אפל סיליקון בעזרת ספריית mlx-vlm. הכימות לארבעה ביטים, עם 5.347 ביטים למשקל וגודל קבוצה של 64, חוסך מקום בזיכרון בלי להכריח אתכם להחזיק כרטיס גרפי כבד של שרתים. הוא מיועד למי שרוצה לעבד תמונות וטקסט יחד על המחשב הנייד שלו בלי לשלוח שום קובץ החוצה.

היתרון הבולט לעומת גרסאות אחרות בגודל הזה הוא חלון הקשר של 262,144 טוקנים, מפתח שמאפשר לזרוק פנימה תמונות ומסמכים ארוכים יחד בלי להיחנק. ההמרה הנוכחית מתבססת על ענף פיתוח שמתקן שכבות MoE ושערים ייעודיים בארכיטקטורה, כך שלא מדובר בסתם קובץ משקלים אלא בהתאמה לקוד הרצה מעודכן.

מתאים ל

  • תיאור תמונות מקומי במק

    מריץ ניתוח תמונה וטקסט מהיר על המחשב בלי לשלוח מידע לרשת ובלי תלות בחיבור חיצוני.

  • ניתוח מסמכים ארוכים

    מנצל חלון של מעל 260 אלף טוקנים כדי להצליב תמונות עם קטעי טקסט נרחבים בתוך הזיכרון.

  • פיתוח אפליקציות שולחניות

    נכנס לזיכרון של מחשבי אפל רגילים ומאפשר לבנות יכולות ראייה ממוחשבת בתוך כלי מקומי.

איפה זה נופל

יוצרי ההמרה מציינים בעצמם שהיא נבנתה מענף תיקון לא רשמי של mlx-vlm לצורך תמיכה בארכיטקטורה החדשה, ועשויה לצאת גרסה אופטימלית יותר בהמשך. בנוסף, כימות של 4 ביט למודל קטן של 4.5 מיליארד פרמטרים עלול לפגוע בהבנת פרטים דקים בתמונות מורכבות או בהסבר של טקסטים צפופים. בדקו טוב את איכות הזיהוי הוויזואלי לפני שאתם מסתמכים עליו.

אותה משפחה

Qwen3.5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על לינוקס או ווינדוס עם כרטיס של אנבידיה?

לא ישירות. הקבצים האלה עברו המרה ייעודית לספריית MLX, שמותאמת אך ורק למעבדי אפל סיליקון. בשביל מערכות אחרות תצטרכו להוריד את משקלי המקור או המרות שמתאימות לכלים אחרים.

האם הכימות לארבעה ביטים פוגע ביכולת שלו להבין תמונות?

כל כימות אגרסיבי גורר ירידה מסוימת בדיוק, בעיקר כשמדובר במודל בסיס קומפקטי של 4.5 מיליארד פרמטרים. אם התמונות שלכם מכילות פרטים קטנים מאוד או דיאגרמות מורכבות, כדאי להשוות את הביצועים מול גרסת ה־8 ביט.

איך מריצים

אתם מריצים אותו על מחשבי מק עם שבבי אפל סיליקון דרך ספריית mlx-vlm בפייתון או בפקודת שורת פקודה פשוטה שמקבלת נתיב לתמונה ופרומפט. בזכות גודל של 2.9 גיגהבייט בדיסק, הוא נכנס בקלות לכל מחשב מק מודרני אפילו עם 8 גיגהבייט זיכרון מאוחד.

אם אתם מחפשים דיוק מקסימלי יש גרסאות של 8 ביט או bf16 באותה קהילה, אבל הן תופסות משמעותית יותר זיכרון. אם אין לכם חומרת אפל או שאתם בונים שירות לפרודקשן עם אלפי בקשות במקביל, כדאי לפנות לשרת ייעודי או להשתמש בנקודת קצה מנוהלת.

pip install -U huggingface_hub
hf download mlx-community/Qwen3.5-4B-MLX-4bit

הרישיון

המודל מופץ תחת רישיון apache-2.0 שירש מהמקור. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומציינים שינויים אם נעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗