GPT
D

DeepSeek-R1-Distill-Qwen-32B-AWQ

קוד פתוח

Valdemardiapache-2.02025-01-20

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

גרסה מכווצת של מודל ההסקה בן 33 מיליארד הפרמטרים שזוקק מ־DeepSeek-R1. היא מיועדת למי שרוצה יכולות חשיבה ופתרון בעיות מורכבות על כרטיס מסך בודד של 24GB בלי לשלם על שרת ענק.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 10,157הורדות בחודש

מה זה

מדובר במודל Qwen-2.5-32B שעבר אימון על נתוני הסקה שנוצרו על ידי DeepSeek-R1, והומר לדיוק של 4 ביט באמצעות AutoAWQ בשיטת GEMM עם קבוצות של 128. המטרה של הזיקוק הזה היא להעביר דפוסי חשיבה ושרשראות לוגיות ממודל של מאות מיליארדי פרמטרים אל מודל צפוף וקומפקטי בהרבה.

במבחני ביצועים המודל המקורי מציג תוצאות חריגות לגודל שלו. הוא מגיע ל־72.6 במבחן המתמטיקה AIME 2024 בבדיקה בודדת, ועולה ל־83.3 כשמייצרים 64 תשובות ומחפשים קונצנזוס, תוצאה שעוקפת את o1-mini. במבחני קוד כמו LiveCodeBench הוא עומד על 57.2 לעומת 53.8 של o1-mini, וב־MATH-500 הוא מגרד את ה־94.3 אחוז. המשמעות היא שבמשימות אלגוריתמיות, מתמטיקה ולוגיקה קשה, המודל הזה מתנהג כמו מודלי ענן מתקדמים ולא כמו מודל קוד פתוח בינוני.

מתאים ל

  • פתרון בעיות אלגוריתמיקה

    מגיע לדירוג 1691 ב־Codeforces ומספק ניתוח מעמיק למשימות תכנות מורכבות מקומית.

  • עיבוד מתמטיקה ולוגיקה

    מחזיק בציון 94.3 ב־MATH-500, מתאים לבדיקת חישובים והוכחות ללא תלות בענן.

  • הרצה מקומית על כרטיס בודד

    משקל של 18GB שמאפשר פריסת מנוע הסקה מתקדם על כרטיס גרפי של 24GB.

איפה זה נופל

היוצרים מזהירים במפורש שסטייה מטווח הטמפרטורה שבין 0.5 ל־0.7 עלולה לגרום לחזרתיות אינסופית או לפלט לא קוהרנטי. בנוסף, מודל המקור R1-Zero סבל מבעיות של ערבוב שפות וקריאות לקויה, ורצוי לבדוק ידנית איך הגרסה הזו מגיבה לעברית ולשאילתות בשפות מעורבות לפני שמחברים אותה למערכת חיה.

שאלות
נפוצות

האם המודל תומך בהקשר ארוך?

כן, המודל מוגדר עם חלון הקשר של עד 131,072 טוקנים. עם זאת, הרצה של הקשרים מלאים בזיכרון תדרוש משאבי VRAM נוספים מעבר ל־18GB של המשקלים עצמם.

מה צריך להגדיר כדי למנוע ממנו להיתקע בלולאות?

בכרטיס המודל נכתב במפורש שיש לכוון את הטמפרטורה בין 0.5 ל־0.7. ערכים אחרים עלולים להוביל לחזרות אינסופיות ולפלט מבולבל.

האם מותר להשתמש בו במוצר מסחרי?

כן. הרישיון הוא Apache-2.0 ומאפשר הטמעה במוצרים מסחריים ושינוי המשקלים, בכפוף לתנאי הרישיון הרגילים.

איך מריצים

המשקל הכולל יושב על 18GB שמחולקים ל־13 קבצים. בזכות דחיסת 4 ביט אפשר להעלות אותו במלואו לזיכרון של כרטיס RTX 3090 או RTX 4090 ביתי עם 24GB VRAM, אם כי לחלון הקשר עמוק במיוחד עד 131,072 טוקנים תצטרכו להגביל את אורך ההקשר או לעבור לכרטיס כפול. מריצים אותו עם ספריית transformers או דרך vLLM עם פרמטרים מתאימים לחלוקת משאבים.

הכרטיס ממליץ במפורש להגדיר טמפרטורה בין 0.5 ל־0.7 בזמן היצירה. אם משימות ההסקה שלכם מזדמנות ואין לכם שרת מקומי עם כרטיס מתאים שרץ כל הזמן, עדיף להשתמש ב־API של DeepSeek שמוזכר בדף במקום לקנות חומרה ייעודית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Valdemardi/DeepSeek-R1-Distill-Qwen-32B-AWQ")
print(pipe("שלום"))

הרישיון

המודל הזה משוחרר ברישיון Apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי קוד, הפצה וזיקוק למודלים אחרים ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗