GPT
R

r1-1776-GGUF

קוד פתוח

unslothmit2025-02-18

  • transformers
  • gguf
  • deepseek_v3
  • text-generation
  • deepseek

גרסה מכווצת של DeepSeek-R1 שעברה אימון המשך להסרת הצנזורה הסינית. מתאימה למי שרוצה יכולות חשיבה וניתוח חופשיות מנושאי טאבו, ומחזיק שרת ייעודי כדי להריץ אותה.

  • 163,840טוקנים בהקשר
  • 5.0 TBמשקל הקבצים
  • 609הורדות בחודש
  • 103לייקים

מה זה

מדובר במודל DeepSeek-R1 שעבר התאמה על ידי Perplexity AI במטרה לנקות צנזורה פוליטית ואידיאולוגית של המפלגה הקומוניסטית הסינית, תוך שמירה על רמת החשיבה והמתמטיקה של המקור. צוות Unsloth לקח את התוצאה ויצר לה גרסאות GGUF מכווצות בשיטה דינמית, שבה חלקים שונים במודל מקבלים רמות דחיסה שונות כדי לצמצם פגיעה בדיוק.

הבדיקות של Perplexity מראות שהמודל שומר על ביצועים זהים ל־R1 המקורי במבחני מתמטיקה והיגיון, אבל מפסיק להתחמק מנושאים רגישים. מבחני ההערכה כללו מעל אלף דוגמאות שנבדקו מול מעריכים אנושיים ומודלים שופטים, והתוצאות מציגות ירידה מהותית בסירוב לענות ובניסוחים מצונזרים ביחס למקור.

מתאים ל

  • פתרון בעיות קוד מורכבות

    יכולות החשיבה של מודל R1 נשמרו במלואן, מה שמאפשר לו לנתח ולכתוב קוד מורכב בלי תלות בענן.

  • ניתוח היסטורי ופוליטי

    הסרת הצנזורה מאפשרת תחקור חופשי של נושאים פוליטיים וסיניים רגישים בלי לקבל תשובות מתחמקות.

  • חישוב והסקה מתמטית

    שומר על ביצועי המקור במבחני לוגיקה ומתמטיקה, ומתאים למשימות אנליטיות בסביבה סגורה ומאובטחת.

איפה זה נופל

גודל הקבצים הופך את ההרצה העצמית לחסם אמיתי לרוב הצוותים, כאשר המאגר כולו מגיע לחמישה טרה בייט עבור כלל הגרסאות. בנוסף, המודל מחייב שמירה קפדנית על מבנה הפרומפט והטוקנים המיוחדים, כולל תגית החשיבה בהתחלה, אחרת איכות התשובות נפגעת. המודל מתועד באנגלית בלבד, וצריך לבדוק בפועל את ההתנהגות שלו מול שאילתות בעברית.

שאלות
נפוצות

כמה זיכרון RAM דרוש להרצת המודל במחשב?

הגרסה הקטנה ביותר דורשת מעל 211 גיגה בייט זיכרון פנוי כדי להיטען, ועוד תוספת למרחב ההקשר. כרטיס מסך בודד של 24 גיגה בייט יכול להאיץ רק חלק קטן מהשכבות, ולכן נדרש שרת עם כמות עצומה של זיכרון RAM או מערך מרובה כרטיסים.

מה ההבדל בין גרסאות ה־UD השונות?

ההבדל מתבטא ברמת הדחיסה ובמשקל הקובץ, החל מ־211 גיגה בייט בגרסת 2bit ועד 377 גיגה בייט בגרסת 4bit. בגרסאות הדינמיות חלקים מרכזיים מקבלים דיוק גבוה יותר, מה ששומר על איכות טובה בהרבה לעומת דחיסה אחידה רגילה.

איך מריצים

כדי להריץ את הדבר הזה מקומית צריך מפלצת חומרה. אפילו הגרסה הכי רזה של שתי סיביות, UD-Q2_K_XL, שוקלת 211 גיגה בייט על הדיסק, ועולה ל־298 גיגה בייט בשלוש סיביות ו־377 גיגה בייט בארבע סיביות. פריקה של שכבות בודדות לכרטיס עם 24 גיגה בייט זיכרון כמו RTX 4090 אפשרית דרך llama.cpp, אבל רוב המשקל יישב על זיכרון המערכת וידרוש מאות גיגה בייטים של RAM.

ההרצה מתבצעת דרך llama.cpp עם דגלים ספציפיים, כולל min-p 0.05 ומבנה פרומפט קשיח שמחייב טוקנים של משתמש, עוזר ותגית חשיבה. אם אין לכם שרת ייעודי עם מספיק זיכרון, עדיף להשתמש ב־API של ספק ענן ולא לנסות להריץ אותו מקומית.

ollama run hf.co/unsloth/r1-1776-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

122 קבצים במאגר, 5.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מפורסם ברישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי קוד והפצה מחדש כמעט ללא הגבלות, כל עוד משאירים את הצהרת זכויות היוצרים המקורית בתוך התוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗