GPT
D

bartowski/DeepSeek-R1-Distill-Llama-8B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-01-20

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קוונטיזציה של מודל ההסקה המזוקק מבית דיפסיק, ארוזה לריצה מקומית על מעבד או כרטיס מסך ביתי בלי להסתמך על שרתים חיצוניים.

  • 145 GBמשקל הקבצים
  • 11,926הורדות בחודש
  • 53לייקים

מה זה

המאגר מציע המרות GGUF של המודל המזוקק של דיפסיק, המבוסס על הארכיטקטורה של לאמה בשמונה מיליארד פרמטרים. המטרה כאן היא להביא יכולות חשיבה ופתרון בעיות של מודל הסקה גדול למבנה קומפקטי שרץ בקלות על מחשב אישי, בעזרת llama.cpp או LM Studio.

כל הקבצים עברו כיול imatrix כדי למזער את הפגיעה בביצועים בזמן הדחיסה. בניגוד למודלים רגילים באותו סדרי גודל, הוא מייצר שרשרת חשיבה מפורטת לפני שהוא פולט את התשובה הסופית. המדידות של שרשראות העיבוד שמצורפות בעמוד מראות שיפור של עד פי אחד וחצי במהירות עיבוד הפרומפט תחת AVX2 כשמשתמשים במבנה הדחיסה החדש, מה שאומר תגובה ראשונית מהירה יותר על מעבדים תואמים.

המשקל הנמוך והמגוון הרחב של רמות הדיוק מאפשרים להכניס אותו ישירות לזיכרון הווידאו של כרטיסים גרפיים פשוטים יחסית. עבור מפתחים מקומיים שמחפשים כלי קל לפיתוח אוטומציות שלא דורש שרת מרוחק, זו נקודת פתיחה יעילה שמספקת פתרון ישיר למשימות מורכבות.

מתאים ל

  • פיתוח כלי הסקה מקומיים

    הוא מריץ שרשרת חשיבה מורכבת על מחשב בודד ומחזיר לוגיקה בלי לשלוח שום מידע החוצה.

  • עבודה על מחשבים ניידים

    גרסאות ה־IQ מאפשרות להריץ תהליכי ניתוח טקסט ישירות על המעבד בלי כרטיס מסך חזק.

  • בדיקת פרומפטים מורכבים

    מבנה התבנית הקשיח מספק סביבה נוחה לבדיקת יכולות פתרון בעיות בסביבת פיתוח פנימית.

איפה זה נופל

הכרטיס לא מציג נתוני שגיאות או ציוני מבחנים למשימות ספציפיות, כך שקשה לדעת מראש מתי ההיגיון שלו נשבר. מעבר לזה, רמות הדחיסה הנמוכות כמו IQ2 או Q2 מוגדרות באיכות נמוכה מאוד, והן עלולות לפגוע ביכולת ההסקה. פורמט הציטוט והשיחה דורש תבנית נוקשה מאוד של תגיות מערכת ומשתמש, ואם תפספסו אותה תקבלו פלט משובש לחלוטין. חובה לבדוק את התנהגות המודל על דוגמאות קצה לפני שסומכים עליו בתהליכים קריטיים.

אותה משפחה

DeepSeek-R1-Distill-Llama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

באיזו גרסת קובץ לבחור אם יש לי כרטיס מסך של שמונה גיגה?

עדיף ללכת על גרסת Q4_K_M ששוקלת 4.92 גיגהבייט. היא מציעה שיווי משקל מצוין בין איכות הטקסט למהירות הריצה, ותשאיר מספיק זיכרון לחלון ההקשר.

האם גרסאות ה־I החדשות מתאימות לעבודה עם כרטיסי AMD?

הן עובדות טוב אם אתם משתמשים בבילד מבוסס rocBLAS, אבל הן לא תואמות למנוע שמבוסס על Vulcan. צריך לבדוק היטב באיזה מנוע תוכנת ההרצה שלכם משתמשת לפני ההורדה.

איך מריצים

אתם צריכים את llama.cpp מגרסה b4514 ומעלה, או פשוט לפתוח אותו בתוכנת LM Studio. עבור ביצועים מהירים, כל הקובץ חייב להיכנס לזיכרון של כרטיס המסך, משהו כמו גיגה או שניים פחות מנפח הזיכרון הכולל של החומרה שלכם.

גרסת Q4_K_M שוקלת קצת פחות מחמישה גיגהבייט ומתאימה לרוב הכרטיסים עם שמונה גיגה זיכרון. אם המטרה היא עבודה שוטפת בייצור עם עומסי תנועה כבדים, עדיף לקרוא למודל דרך שירות ענן מסודר במקום לתחזק חומרה מקומית שמגבילה את קצב הבקשות.

ollama run hf.co/bartowski/DeepSeek-R1-Distill-Llama-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המאגר לא דווח כלל בעמוד. המשמעות היא שאין לכם אישור משפטי מוגדר להשתמש בו במוצר מסחרי, ואתם נחשפים לסיכון זכויות יוצרים. לפני שמשלבים אותו בקוד שמיועד ללקוחות, צריך לבדוק את הרישיון המקורי של המודל שעליו הוא התבסס.

הרישיון המלא בעמוד המודל ↗