GPT
D

DeepSeek-R1-Distill-Qwen-14B-GGUF

קוד פתוח

unslothapache-2.02025-01-20

  • transformers
  • gguf
  • deepseek
  • qwen
  • qwen2

גרסת GGUF מכווצת של מודל החשיבה והזיקוק של דיפסיק על בסיס קוון 14B. היא מביאה יכולות פתרון בעיות ומתמטיקה של מודל ענק לגודל שרץ על חומרה מקומית סבירה.

  • 89.3 GBמשקל הקבצים
  • 62,628הורדות בחודש
  • 135לייקים

מה זה

מדובר במודל שמבוסס על Qwen2.5-14B ואומן בזיקוק על בסיס 800 אלף דוגמאות חשיבה שהופקו מהמודל המלא של DeepSeek-R1. המטרה כאן היא להעתיק את שרשרת המחשבה וההסקה של מודל ענק לתוך נפח פרמטרים שמתאים להתקנה מקומית.

במבחני ביצועים, המודל הזה מציג תוצאות חריגות לממדיו. במבחן המתמטיקה MATH-500 הוא מגיע לדיוק של 93.9 אחוז, ובמבחן AIME 2024 הוא משיג 69.7 אחוז במענה ראשון, נתונים שעוקפים מודלים קנייניים כבדים כמו GPT-4o ומתקרבים לביצועי o1-mini. במבחן התכנות LiveCodeBench הוא עומד על 53.1 אחוז, מה שמציב אותו כפתרון חזק לקוד ופתרון בעיות טכניות בלי צורך בתשתית ענן עצומה.

מתאים ל

  • פתרון בעיות מתמטיות

    משיג 93.9 אחוז במבחן MATH-500 ומתאים למשימות אלגוריתמיות וחישוב מורכב.

  • ניתוח וייצור קוד

    מציג ביצועים גבוהים ב־LiveCodeBench ומסייע באיתור באגים מקומי בלי ענן.

  • הסקה לוגית בשרשרת מחשבה

    מפיק נימוקים מעמיקים שלב אחר שלב למערכות שדורשות פלט עם הסבר מפורט.

איפה זה נופל

היוצרים מדגישים שחובה להגדיר טמפרטורה מדויקת בין 0.5 ל־0.7 כדי למנוע מהמודל להיכנס לחזרות אינסופיות או לפלוט טקסט לא קוהרנטי. בנוסף, חל איסור מפורש להשתמש ב־System Prompt. כל ההנחיות חייבות להיכנס ישירות לתוך שאלת המשתמש יחד עם הטוקנים המיוחדים של השיחה, אחרת איכות הפלט נפגעת. המודל מתועד באנגלית בלבד ואינו כולל תמיכה ייעודית בעברית.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש ב־System Prompt רגיל בהרצה?

לא. ההוראות של המפתחים קובעות במפורש להימנע לחלוטין מ־System Prompt. יש לכתוב את כל ההוראות והאילוצים בתוך ה־User Prompt ולהוסיף את הטוקנים הייעודיים של השיחה כדי שההסקה תעבוד נכון.

איזה כרטיס מסך נדרש כדי להריץ את גרסת ה־GGUF?

הכרטיס שהיצרן ממליץ עליו לדוגמה הוא כרטיס עם 24GB זיכרון כמו RTX 4090, שמאפשר להוריד חלק ניכר מהשכבות לעיבוד מקבילי מהיר. אפשר להריץ גם על מעבד רגיל עם זיכרון RAM מתאים דרך llama.cpp, אבל קצב הפקת הטוקנים יהיה איטי משמעותית.

איך מריצים

כדי להריץ אותו משתמשים בתוכנת llama.cpp דרך שורת הפקודה, כאשר Unsloth מדגימים שימוש בקובץ בכימות Q4_K_M. מומלץ להגדיר כרטיס מסך בודד של 24GB, למשל RTX 4090, שמאפשר להעביר אליו שכבות חישוב בעזרת הדגל n-gpu-layers כדי לקבל מהירות תגובה סבירה, לצד מעבד חזק עם מספיק זיכרון.

אם אין לכם כרטיס עם זיכרון ייעודי של 16GB עד 24GB או שאתם צריכים תפוקה לעשרות משתמשים במקביל, שווה לשקול מעבר לשירות ה־API של DeepSeek. הריצה המקומית הגיונית בעיקר כשחייבים פרטיות מידע מוחלטת או כשרוצים לעבוד בסביבה מנותקת רשת.

ollama run hf.co/unsloth/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המודל הוא Apache 2.0 מלא. הוא מתיר שימוש מסחרי חופשי, שינוי קוד ומשקלים, הפצה פנימית ושילוב במוצרים, כולל זיקוק והפקת נתונים לאימון מודלים נוספים, ללא תמלוגים ובכפוף לשמירת תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗