GPT
D

deepseek-llm-7B-chat-GGUF

קוד פתוח

TheBlokeother2023-11-29

  • transformers
  • gguf
  • deepseek
  • conversational

גרסת GGUF מכווצת של מודל שיחה עם 7 מיליארד פרמטרים שאומן מאפס על שני טריליון טוקנים. פתרון קומפקטי למי שמחפש מודל מקומי שמבין אנגלית וסינית בלי לחנוק את החומרה.

  • 49.5 GBמשקל הקבצים
  • 8,163הורדות בחודש
  • 38לייקים

מה זה

מדובר במודל שיחה שאומן ישירות על ידי DeepSeek על בסיס נתונים דו לשוני ענק של שני טריליון טוקנים באנגלית ובסינית, ועבר התאמה ייעודית למענה להוראות. TheBloke לקח את משקלי המקור והמיר אותם לפורמט GGUF במספר דרגות כיול, מה שמאפשר להריץ אותו ישירות דרך כלי קוד פתוח מוכרים ללא צורך בהקמת סביבת פייתון כבדה.

היתרון שלו בגזרת ה־7B מגיע בעיקר מנפח האימון ההתחלתי. הוא מיועד לתת מענה קל משקל שרץ מהר על מעבדים ביתיים או כרטיסי מסך בודדים, בלי התלות ברשת או בשירותי ענן יקרים שמקובלים במודלים הגדולים יותר.

מתאים ל

  • בוט שיחה מקומי באנגלית

    רץ ישירות על מחשב אישי בלי לחשוף מידע לרשת, ומתאים למענה על שאלות בסיסיות באנגלית או בסינית.

  • פיתוח עם llama-cpp-python

    מאפשר לשלב שירות שיחה קל משקל בקוד עצמאי בלי לנהל תלויות כבדות של PyTorch.

  • בדיקת יישומי שפה במחשב נייד

    קובץ ה־Q4_K_M דורש פחות מ־7 גיגה זיכרון, מה שמאפשר לבצע בדיקות פיתוח גם ללא כרטיס מסך ייעודי.

איפה זה נופל

המגבלה הטכנית הבולטת והרשמית בכרטיס היא היעדר תמיכה ב־System Prompt. המפתחים מדגישים מפורשות שלא להגדיר הנחיות מערכת, מה שמקשה מאוד לשלוט באישיות, בפורמט הפלט או בהגדרת כללים נוקשים לשיחה. מעבר לכך, האימון התמקד באנגלית ובסינית בלבד, כך שאין לצפות לביצועים סבירים בעברית.

אותה משפחה

deepseek-llm יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך כל הקבצים ברשימה?

עבור רוב השימושים מומלץ להוריד את Q4_K_M, ששוקל 4.22 גיגה-בייט ומספק איזון מעולה בין מהירות לאיכות. אם יש לכם מספיק זיכרון ואתם רוצים דיוק מרבי, לכו על Q5_K_M. הימנעו מגרסאות נמוכות כמו Q2_K שמביאות לירידה מורגשת באיכות הפלט.

איך צריך לנסח את הפניות למודל בזמן שיחה?

המודל תוכנן לתבנית פשוטה מאוד שמתחילה במילה User ולאחריה הטקסט שלכם, ואז Assistant בשורה נפרדת. חשוב מאוד לא לכלול System Prompt בהודעות, כי המודל לא תומך בזה לפי הנחיות היצרן.

איך מריצים

אין צורך להוריד את כל המאגר ששוקל 49.5 גיגה-בייט, אלא בוחרים קובץ בודד. הקובץ המאוזן והמומלץ לרוב השימושים הוא Q4_K_M ששוקל 4.22 גיגה-בייט ודורש כ־6.72 גיגה-בייט זיכרון עבודה בהרצה על מעבד בלבד. אם רוצים איכות מעט גבוהה יותר, קובץ Q5_K_M תופס 4.93 גיגה-בייט ודורש כ־7.43 גיגה-בייט זיכרון.

אפשר להריץ את הקבצים ישירות דרך llama.cpp בפקודת שורה אחת, או לטעון אותם לממשקים גרפיים כמו LM Studio ו־text-generation-webui. אם יש כרטיס מסך עם לפחות 6 עד 8 גיגה-בייט זיכרון ייעודי, מומלץ להעביר אליו את השכבות עם הדגל ngl כדי לקבל קצב הפקה מהיר, אחרת הריצה תתבצע על המעבד והזיכרון הרגיל של המחשב.

ollama run hf.co/TheBloke/deepseek-llm-7B-chat-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המאגר מוגדר כ־other, אך ברישומי המקור מצוין שקוד התשתית הוא תחת MIT ומשקלי המודל כפופים לרישיון מותאם של DeepSeek שמתיר שימוש מסחרי. יש לבדוק את תנאי קובץ LICENSE-MODEL המקורי לפני שילוב במוצר כדי לוודא שאין הגבלות שימוש ספציפיות.

הרישיון המלא בעמוד המודל ↗