GPT
D

deepseek-r1-qwen-2.5-32B-ablated-GGUF

קוד פתוח

bartowskimit2025-01-23

  • gguf
  • ablated
  • ablation
  • abliterated
  • uncensored

גרסת GGUF שעברה כימות של מודל החשיבה וההסקה בגודל שלושים ושניים מיליארד פרמטרים, המבוסס על סדרת קוון. היא מתאימה למי שרוצה להריץ יכולות היסק עמוקות על חומרה מקומית נגישה.

  • 475 GBמשקל הקבצים
  • 2,883הורדות בחודש
  • 89לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית NaniDAO לפורמט GGUF בעזרת llama.cpp, תוך שימוש במטריצת חשיבות כדי למזער פגיעה בדיוק. הגרסה הזו מבוססת על הארכיטקטורה של Qwen 2.5 בגודל של 32 מיליארד פרמטרים, עם שילוב תהליכי החשיבה שמאפיינים את מודלי R1, ומיועדת למשימות שמצריכות פתרון בעיות שלב אחר שלב.

היתרון המרכזי כאן מול מודלים רגילים באותו סדר גודל הוא התמקדות בפתרון בעיות מורכבות במקום ביצירת טקסט שוטף בלבד. הכימותים כוללים וריאציות שבהן משקלי הקלט והפלט נשמרים ברמת דיוק גבוהה של שמונה ביט, מה שמצמצם את אובדן היכולת הלשונית וההגיונית גם כשדוחסים את שאר השכבות לקבצים קטנים בהרבה.

מתאים ל

  • פתרון בעיות לוגיות וקוד

    ארכיטקטורת החשיבה מתאימה לפירוק משימות תכנות מורכבות, ומשקל עשרים ג'יגה מאפשר להריץ אותה על כרטיס בודד.

  • עיבוד מידע רגיש מקומית

    הרצה מקומית מלאה ללא תלות ברשת מתאימה לניתוח מסמכים בארגונים שאינם מורשים להוציא מידע לשרתי ענן חיצוניים.

  • הסקה על חומרת מעבד ו־ARM

    התמיכה המובנית באריזה מחדש של משקולות מתאימה לשרתים ללא מאיצים גרפיים שדורשים ביצועי מעבד סבירים.

איפה זה נופל

החיסרון העיקרי מגיע מירידת האיכות הבלתי נמנעת בדחיסות הנמוכות. בגרסאות של שניים ושלושה ביט, למרות השימוש בכימותים מודרניים, המודל מאבד מדיוק החשיבה שלו ועלול לפספס שלבים לוגיים קריטיים במשימות קוד או מתמטיקה מורכבות.

בנוסף, הכרטיס לא מספק תוצאות מדידה מסודרות למודל זה עצמו, למעט בדיקות השוואה ישנות על מודל אחר, כך שחובה לבדוק אותו עצמאית מול מקרי הקצה שלכם. הוא גם מחייב פורמט פרומפט ייחודי עם תגיות מערכת והודעות ספציפיות, ואם לא מקפידים עליו בדיוק, התוצאות משתבשות לחלוטין.

שאלות
נפוצות

איזו גרסת קובץ הכי כדאי להוריד מתוך כל האפשרויות?

ברירת המחדל המאוזנת ביותר היא Q4_K_M, שמשלבת איכות טובה עם משקל של כעשרים ג'יגה בייט. אם יש לכם זיכרון גרפי של 24 ג'יגה בייט, זו הבחירה הטבעית שתשמור על מהירות ודיוק. למי שמוגבל בזיכרון, אפשר לרדת ל־IQ4_XS או לכימותי שלוש ביט, אך במחיר של ירידה מורגשת ביכולות ההיסק.

האם המודל ירוץ טוב במחשבי מק או על מעבדים רגילים?

אפשר להריץ אותו על מעבדי אינטל, AMD ומעבדי סיליקון של אפל דרך llama.cpp, אבל קצב ייצור הטוקנים יהיה איטי משמעותית בהשוואה למעבד גרפי ייעודי. קבצים כמו Q4_0 או IQ4_NL מנצלים אריזה מחדש בזמן אמת כדי לשפר את הביצועים בארכיטקטורות אלו, אך עדיין מדובר בזמני המתנה ארוכים יותר.

איך מריצים

כדי להריץ אותו במהירות סבירה ישירות מהכרטיס הגרפי, צריך לכוון לגרסה שנכנסת במלואה לתוך הזיכרון שלו. הקבצים נעים בין פחות מעשרה ג'יגה בייט בגרסאות הדחוסות ביותר של שני ביט, לבין מעל שישים וחמישה ג'יגה בייט בקובץ המלא. גרסת Q4_K_M שוקלת קצת פחות מעשרים ג'יגה בייט, כך שהיא דורשת כרטיס עם 24 ג'יגה בייט זיכרון כדי לפעול כולה על המעבד הגרפי.

אפשר להשתמש בכלים כמו LM Studio או ישירות דרך llama.cpp, ויש תמיכה באריזה מחדש של משקולות בזמן אמת לשיפור ביצועים במעבדי ARM ו־AVX. מי שמחזיק מעבדים גרפיים של AMD צריך לוודא שהוא עובד עם rocBLAS ולא עם Vulkan אם הוא בוחר בכימותי IQ, אחרת הביצועים ייפגעו או שהרצה תיכשל.

ollama run hf.co/bartowski/deepseek-r1-qwen-2.5-32B-ablated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 475 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. המשמעות היא חופש פעולה רחב מאוד, כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או חיצונית, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗