GPT
C

cognitivecomputations_Dolphin3.0-R1-Mistral-24B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-02-07

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • imatrix

גרסת קוונטיזציה של מודל חשיבה מבוסס מיסטרל עם 24 מיליארד פרמטרים. פתרון מתאים למי שרוצה הרצה מקומית של יכולות ניתוח עמוקות בלי תלות בשרת חיצוני.

  • 393 GBמשקל הקבצים
  • 12,966הורדות בחודש
  • 86לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית cognitivecomputations לפורמט GGUF באמצעות הכלי llama.cpp. הבסיס הוא מודל של 24 מיליארד פרמטרים שאימן אריק הרטפורד, המכוון לחשיבה לוגית ולניתוח מעמיק בשיטת עקרונות ראשוניים.

הייחוד כאן הוא שיטת החשיבה המובנית. הוא משתמש בתגיות ייעודיות לתהליך המחשבה לפני הפקת התשובה הסופית, ומבצע ניתוח שורש של לפחות שישה שלבים לבעיות מורכבות, אלא אם מדובר בשאלה פשוטה שאינה דורשת מאמץ.

הממיר bartowski השתמש בכיול imatrix כדי למזער איבוד מידע בדחיסה. ההבדל המרכזי מול מודלים רגילים בסדר הגודל הזה מתבטא ביכולת לעצור ולפרק את הבעיה לפני יצירת הטקסט, במקום לפלוט תשובה מידית.

מתאים ל

  • ניתוח בעיות מורכבות

    הוא מפרק שאלות טכניות מורכבות בעזרת תהליך חשיבה מובנה של שישה שלבים לפחות.

  • הרצה מקומית על כרטיס יחיד

    גרסאות ה־Q4 נכנסות במלואן לכרטיסי מסך בעלי 16 עד 24 גיגה בייט של זיכרון.

  • סיוע בכתיבת קוד

    היכולת לבצע ניתוח שורש עוזרת באיתור תקלות לוגיות במערכות תוכנה באנגלית.

איפה זה נופל

המודל הוגדר רשמית לשפה האנגלית בלבד, ולכן הוא לא מתאים לעיבוד שוטף של טקסטים בעברית. תהליך החשיבה המובנה, שדורש לפחות שישה שלבי ניתוח, מייצר עיכוב ניכר בקבלת התשובה ולא מתאים למערכות שדורשות מענה מהיר. בנוסף, קבצי ה־IQ דורשים תמיכה בחומרה ספציפית ואינם תואמים לממשק וולקן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

קובץ Q4_K_M הוא נקודת הפתיחה הטובה ביותר כי הוא שוקל 14.33 גיגה בייט ומאזן היטב בין איכות התוצאה לצריכת הזיכרון. אם יש לכם כרטיס מסך עם 24 גיגה בייט, גרסת Q5_K_M או Q6_K תיתן דיוק גבוה יותר.

האם המודל מתאים למוצרים שדורשים מהירות תגובה גבוהה?

לא. מנגנון החשיבה המובנה מחייב את המודל לייצר ניתוח מקדים ארוך לפני שהוא עונה, מה שמוסיף שניות ארוכות לכל פנייה.

איך מריצים

להרצה מלאה בזיכרון של כרטיס המסך, צריך כרטיס עם לפחות 16 עד 24 גיגה בייט של זיכרון ייעודי עבור קבצי ה־Q4 או ה־Q5 הפופולריים. הקובץ המומלץ לרוב השימושים, Q4_K_M, שוקל 14.33 גיגה בייט ודורש זיכרון מעט גדול מכך כדי לרוץ בצורה חלקה.

אפשר להריץ את הקבצים ישירות בתוך llama.cpp או דרך ממשקים כמו LM Studio. אם כרטיס המסך שלכם כולל פחות מ־12 גיגה בייט, עדיף להשתמש בגרסאות מכווצות כמו IQ3_M או לקרוא למודל דרך שירות ענן, כי שילוב זיכרון המערכת הרגיל יאט משמעותית את קצב הפקת הטקסט.

ollama run hf.co/bartowski/cognitivecomputations_Dolphin3.0-R1-Mistral-24B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

31 קבצים במאגר, 393 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא דיווח על רישיון שימוש בעמוד המודל. במצב כזה לא ברור אם מותר להשתמש בקבצים למטרות מסחריות, לשלב אותם במוצר פעיל או להפיץ אותם מחדש. מפתחים שמתכננים שימוש מסחרי צריכים לבדוק את הרישיון המקורי של המודל לפני שילובו בפרויקט.

הרישיון המלא בעמוד המודל ↗