GPT
D

DeepSeek-R1-Distill-Qwen-32B-4bit

קוד פתוח

mlx-communityרישיון לא דווח2025-01-21

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • mlx

גרסה מכווצת של מודל ההסקה מבית דיפסיק שרצה ישירות על מחשבי מק. מקבלים יכולות ניתוח וחשיבה מורכבות מקומית, בלי תלות בשרתים חיצוניים או שליחת מידע החוצה.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 17.2 GBמשקל הקבצים
  • 3,692הורדות בחודש

מה זה

מדובר בהמרה של מודל ההסקה המזוקק של דיפסיק, המבוסס על הארכיטקטורה של קוון עם קרוב לשלושים ושלושה מיליארד פרמטרים, ישירות לפורמט שמתאים למחשבי אפל. במקום להריץ את המשקלים המלאים שדורשים חומרה כבדה ויקרה, עשו כאן כימות לארבעה ביט כדי שתוכלו לטעון אותו על זיכרון של מחשב אישי.

הייחוד כאן הוא השילוב בין שיטת ההסקה של דיפסיק לבין הבסיס החזק של קוון, יחד עם חלון הקשר ענקי של מעל מאה ושלושים אלף טוקנים. זה אומר שאתם יכולים להזין לו קבצי קוד ארוכים, תיעוד טכני נרחב או מסמכים מורכבים, ולתת לו לחשוב ולפרק את הבעיה לפני שהוא עונה, בלי להיחנק ממגבלת מקום בזיכרון העבודה.

מתאים ל

  • ניתוח קוד מקומי

    חלון הקשר ענק מאפשר להזין פרויקט שלם ולמצוא באגים בלי להוציא קוד קנייני לענן.

  • פתרון בעיות לוגיות

    תהליך ההסקה המובנה מסייע לפרק משימות אלגוריתמיות מורכבות שלב אחר שלב ישירות על המק.

  • עיבוד מסמכים רגישים

    הרצה מקומית מוחלטת שמתאימה לניתוח טקסטים ארוכים ופרטיים שלא יכולים לעבור דרך שרתי צד שלישי.

איפה זה נופל

כרטיס המודל לא חושף ציוני מבחנים, מדדי דיוק או מגבלות רשמיות, ולכן חובה לבדוק אותו עצמאית לפני שסומכים עליו. הכימות לארבעה ביט עלול לפגוע באיכות הפלט במשימות שדורשות דיוק מתמטי קיצוני לעומת משקלי המקור. בנוסף, מודלים מסוג זה נוטים לפעמים להאריך מאוד בתהליך החשיבה שלהם, מה שגוזל זמן יקר ומאט את קבלת התשובה הסופית. צריך גם לבחון היטב איך הוא מתמודד עם עברית, שכן בסיס האימון ממוקד בעיקר באנגלית ובסינית.

שאלות
נפוצות

האם המודל יעבוד על מחשב מק עם מעבד אינטל?

לא. ספריות MLX פותחו ספציפית עבור המעבדים של אפל סיליקון, ולכן המודל מחייב שבבי M1 ומעלה כדי לפעול.

כמה זיכרון בפועל נדרש כדי לעבוד איתו בצורה חלקה?

הקבצים תופסים מעל שבעה עשר גיגהבייט, ולכן מומלץ מחשב עם שלושים ושניים גיגהבייט זיכרון אחוד לפחות כדי ליהנות גם מהקשר ארוך בלי קריסות.

איך מריצים

כדי להריץ אותו מתקינים את חבילת mlx-lm בפייתון וטוענים את המשקלים בקוד קצר שמפעיל את תבנית השיחה המובנית. הקבצים שוקלים קצת יותר משבעה עשר גיגהבייט, כך שתצטרכו מק עם לפחות עשרים וארבעה או שלושים ושניים גיגהבייט של זיכרון אחוד כדי שהמערכת לא תיחנק כשההקשר גדל.

אם יש לכם מחשב עם שישה עשר גיגהבייט זיכרון בלבד, הוא כנראה יקרוס או יזחל. במצב כזה, או אם אתם צריכים לשרת עשרות משתמשים במקביל בזמן תגובה מהיר, עדיף להשתמש בחיבור לשירות ענן מרוחק ולא להעמיס על המחשב המקומי.

from transformers import pipeline

pipe = pipeline("text-generation", model="mlx-community/DeepSeek-R1-Distill-Qwen-32B-4bit")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון כלל. המצב הזה מציב סיכון משפטי ברור, כי אין לכם היתר מפורש להשתמש בו במוצרים מסחריים או להפיץ אותו הלאה. אם אתם בונים פתרון לחברה או ללקוחות, כדאי לבדוק קודם את תנאי השימוש של מודל המקור המקורי.

הרישיון המלא בעמוד המודל ↗