GPT
D

deepseek-ai_DeepSeek-R1-0528-Qwen3-8B-GGUF

קוד פתוח

bartowskimit2025-05-29

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת למודל חשיבה של שמונה מיליארד פרמטרים. היא נותנת יכולות הסקה מעמיקות על חומרה מקומית רגילה בלי לשלם על שירותי ענן.

  • 121 GBמשקל הקבצים
  • 5,327הורדות בחודש
  • 51לייקים

מה זה

המאגר הזה מציע המרות שונות בפורמט GGUF למודל של שמונה מיליארד פרמטרים מבית deepseek-ai, שנבנה על בסיס ארכיטקטורת Qwen3 ומיועד להסקה לוגית. ההמרות נעשו באמצעות גרסה b5524 של llama.cpp תוך שימוש במערך נתונים ייעודי לכיול חכם שנועד למזער את איבוד המידע בדיוקים הנמוכים.

בגודל הזה של שמונה מיליארד פרמטרים, הדגש הוא על יכולת חשיבה והפקת תשובות מורכבות במחשב אישי או שרת קטן. המודל דורש מבנה תבנית ספציפי שכולל תגיות התחלה, הגדרת מערכת, משתמש ועוזר. אם לא שומרים על המבנה הזה בדיוק, איכות התשובות נפגעת משמעותית.

חלק מהגרסאות כאן משתמשות בשיטה שמבודדת את שכבות הקלט והפלט ושומרת עליהן ברמת דיוק גבוהה של שמונה ביט, בזמן ששאר המשקולות מכווצות יותר. זה שומר על עקביות התחביר והתשובות בלי לנפח את כל הקובץ.

מתאים ל

  • הסקה לוגית מקומית

    מתאים לפתרון בעיות חישוב ותכנות במחשב מקומי בלי להוציא מידע לרשת.

  • הרצה על חומרה מוגבלת

    גרסאות הדחיסה מאפשרות להפעיל מודל של שמונה מיליארד פרמטרים במעבדי ARM ומחשבים ניידים.

  • בוט פרטי ללא ענן

    משתלב בתוך LM Studio לעבודה שוטפת מול קבצים אישיים בדיסקרטיות מלאה.

איפה זה נופל

הכרטיס מגדיר את גרסאות שתי הביט והשלוש ביט הנמוכות כבעלות איכות ירודה, והן נוטות לייצר שגיאות או לאבד את חוט המחשבה הלוגי. מעבר לזה, המודל מחייב שימוש קפדני בתבנית הטקסט של deepseek-ai כדי לעבוד בצורה תקינה. בכרטיס לא מופיעים נתוני ביצועים רשמיים או בדיקות השוואתיות של המודל הספציפי הזה, כך שחובה לבדוק את התוצרים במשימות שלכם לפני שמחברים אותו לקוד אמיתי.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך כל הרשימה?

מורידים רק קובץ אחד ולא את כל הספרייה. הבחירה המאוזנת ביותר היא Q4_K_M ששוקל קצת מעל חמישה גיגה בייט ומספק איכות טובה. אם יש לכם פחות זיכרון, אפשר לרדת לגרסאות ה־IQ כמו IQ4_XS או IQ3_M.

איך צריך לשלוח אליו את הטקסט כדי לקבל תשובות הגיוניות?

המודל דורש תבנית קשיחה כדי לפעול כראוי. חובה להשתמש בתגית פתיחה, להוסיף את הנחיית המערכת, ולאחר מכן לסגור ולפתוח עם תגיות ייעודיות למשתמש ולעוזר לפי הדוגמה בכרטיס.

איך מריצים

מורידים קובץ בודד בלבד לפי הזיכרון הפנוי. הגרסאות מתחילות מפורמט BF16 מלא במשקל 16.39 גיגה בייט, ומגיעות עד דחיסה אגרסיבית של IQ2_M ששוקלת 3.05 גיגה בייט בלבד. לרוב המשתמשים כדאי לקחת את Q4_K_M ששוקל 5.03 גיגה בייט ודורש כרטיס מסך עם שמונה גיגה בייט זיכרון כדי לרוץ כולו מקומית במהירות גבוהה.

אפשר להריץ אותו דרך LM Studio או ישירות באמצעות llama.cpp. גרסאות ישנות יותר כמו Q4_0 תומכות בסידור מחדש של משקולות בזמן אמת לטובת מעבדי ARM ופקודות AVX. אם אין לכם לפחות שמונה גיגה זיכרון פנוי בכרטיס או במחשב, כדאי לשקול קריאה לשרת מרוחק במקום לנסות לדחוף גרסאות מכווצות מדי למעבד רגיל.

ollama run hf.co/bartowski/deepseek-ai_DeepSeek-R1-0528-Qwen3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

27 קבצים במאגר, 121 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא רישיון MIT. הוא מתיר שימוש מסחרי חופשי, עריכה, הפצה והטמעה במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור על האחריות בקוד או בתיעוד המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗