GPT
D

bartowski/DeepSeek-R1-Distill-Qwen-1.5B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-01-20

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת של מודל החשיבה הקטן מבית דיפסיק, שמאפשרת להריץ יכולות היסק לוקאלית על מחשבים פשוטים בלי כרטיס מסך מפלצתי ותופסת בקושי גיגה וחצי של זיכרון.

  • 33.0 GBמשקל הקבצים
  • 22,224הורדות בחודש
  • 88לייקים

מה זה

מדובר במודל שמבוסס על Qwen בנפח של מיליארד וחצי פרמטרים, שעבר זיכוך על בסיס פלטים של DeepSeek-R1. המטרה כאן היא להביא תהליכי חשיבה ופתרון בעיות לוגיות מורכבות למשקל נוצה, כזה שנכנס בקלות לזיכרון של כל לפטופ מודרני.

הקובץ המקורי כוּוץ על ידי המשתמש bartowski באמצעות כלי llama.cpp וטכניקת imatrix כדי לשמור על דיוק מקסימלי למרות אובדן המשקל. בנפח של 1.5B מודלים בדרך כלל מתקשים להחזיק שיחה עקבית או לייצר פתרונות מתמטיים בלי להזות, אבל טכניקת הזיכוך מ־R1 מזריקה לו יכולת לייצר שרשרת חשיבה מסודרת לפני מתן התשובה.

מתאים ל

  • היסק לוקאלי במכשיר קצה

    הקובץ שוקל מעט מעל גיגה, מה שמאפשר להריץ שרשראות חשיבה מקומיות במחשב ישן או מכשיר חלש בלי תלות ברשת.

  • ניסויים ופיתוח פנימי

    פורמט ה־GGUF והמשקל הנמוך מאפשרים לטעון אותו מהר ב־LM Studio כדי לבדוק התנהגות של פרומפטים לוגיים.

  • פתרון בעיות על מעבדי ARM

    גרסת Q4_0 מנצלת סידור משקלים אוטומטי בזיכרון ומאפשרת לקבל מהירות עיבוד טובה על חומרת מעבד בלבד.

איפה זה נופל

זה עדיין מודל זעיר של 1.5B, וכדאי ליישר ציפיות לגבי היכולות שלו. הוא אולי יודע לפלוט שרשרת חשיבה, אבל בגלל הגודל הוא נוטה להיתקע בלולאות של מחשבה, לפספס עובדות בסיסיות או להציג ביטחון עצמי מופרז בתשובות שגויות לגמרי. בנוסף, גרסאות הכיווץ הנמוכות ביותר כמו סדרת ה־IQ2 וה־Q2 מאבדות איכות בצורה מורגשת ומתאימות רק אם אתם חנוקים לחלוטין במשאבים.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ מומלץ להוריד מתוך כל הרשימה?

עבור רוב האנשים, קובץ DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf הוא הבחירה הבטוחה ביותר. הוא שוקל 1.12GB, מספק איכות טובה ביחס למשקל ולא זולל משאבים. אם יש לכם מספיק מקום בזיכרון, אפשר לעלות ל־Q5_K_M או Q6_K כדי לשפר מעט את רמת הדיוק.

האם הוא יעבוד לי מהר בלי כרטיס מסך של אנבידיה?

כן, המודל הזה קל מאוד ויכול לרוץ מצוין גם על מעבד רגיל בלבד דרך llama.cpp. גרסאות כמו Q4_0 או IQ4_NL מציעות אופטימיזציה מיוחדת לחומרת ARM ו־AVX, כך שאפשר לקבל ביצועים סבירים לחלוטין גם ללא GPU.

איך מריצים

בשביל להריץ אותו לא צריך חוות שרתים, אפילו מעבד רגיל יסחוב אותו בלי להזיע. פשוט מורידים קובץ בודד, למשל DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf ששוקל 1.12GB, וטוענים אותו בתוכנה כמו LM Studio או ישירות דרך llama.cpp. יש לו 24 רמות שונות של כיווץ, החל מ־f32 ששוקל מעל שבעה גיגה ועד IQ2_M שיורד ל־700MB בלבד.

אם יש לכם מעבדי ARM או מעבדי אינטל עם AVX, גרסת Q4_0 מציעה סידור זיכרון אוטומטי לשיפור מהירות העיבוד. לרוב השימושים גרסאות כמו Q4_K_M או Q5_K_M נותנות את הפשרה הכי נכונה בין מהירות לשמירה על היגיון.

ollama run hf.co/bartowski/DeepSeek-R1-Distill-Qwen-1.5B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של bartowski. במצב כזה אי אפשר לדעת רשמית מה מותר או אסור לעשות איתו, ובטח שלא כדאי לשלב אותו במוצר מסחרי לפני שבודקים את הרישיון של מודל המקור deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B.

הרישיון המלא בעמוד המודל ↗