GPT
C

cognitivecomputations_Dolphin-Mistral-24B-Venice-Edition-GGUF

קוד פתוח

bartowskiapache-2.02025-05-09

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסה מכווצת של מודל פתוח בגודל 24B למי שרוצה להריץ מודל טקסט מקומית בלי חסימות של ספקי ענן. הוא נבנה עבור llama.cpp ומתאים למי שמחפש חופש פעולה מלא.

  • 357 GBמשקל הקבצים
  • 25,157הורדות בחודש
  • 166לייקים

מה זה

מדובר בהמרה של המודל Dolphin-Mistral-24B-Venice-Edition לפורמט GGUF, שבוצעה באמצעות llama.cpp עם כיול imatrix. המטרה כאן היא לאפשר הרצה מקומית של מודל יצירת טקסט בגודל 24 מיליארד פרמטרים, גודל שמציע פשרה נוחה בין יכולות ניסוח והבנה לבין משאבי מחשוב סבירים. סדרת דולפין ידועה בכך שהיא מסירה מגבלות צנזורה נפוצות, וגרסת ונציה מכוונת בדיוק לתרחישים האלה שבהם לא רוצים שהמודל יסרב לענות.

הקובץ המקורי שוקל מעל 47 גיגה בייט בפורמט BF16, אבל המגוון כאן כולל עשרות רמות דחיסה שונות. יש כאן גרסאות ששומרות על איכות גבוהה יחסית, כמו Q6_K או Q5_K_M, ויש גרסאות מכווצות באגרסיביות שמגיעות עד רמות של 2 ביט. בגלל שהכיול נעשה עם imatrix, המודל שומר על יציבות סבירה גם במידות הדחיסה הבינוניות.

מתאים ל

  • עבודה מקומית ללא צנזורה

    מתאים לניתוח ויצירת טקסט חופשי בלי סירובים של מודלים מסחריים סגורים.

  • שרת עצמאי על חומרה בינונית

    קובץ Q4_K_M נכנס לכרטיס עם 16GB זיכרון ומאפשר ריצה מקומית מלאה.

  • פיתוח יישומים מבוססי llama.cpp

    התאמה מלאה לכלי הפצה מקומיים כמו LM Studio בזכות פורמט GGUF.

איפה זה נופל

הכרטיס לא מציג תוצאות מדידה מסודרות או בנצ'מרקים של המודל המקורי, אלא רק נתוני מהירות טכניים של llama.cpp על מעבדי שרת. בנוסף, כל הגרסאות שמתחת ל־4 ביט, כולל משפחת ה־IQ2 וה־Q2, מוגדרות מראש באיכות נמוכה עד נמוכה מאוד. מעבר לזה, המודל דורש תבנית פרומפט נוקשה מאוד שכוללת תגיות מערכת והוראה ייחודיות, ואם לא תגדירו אותה במדויק תקבלו פלט שבור.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

ברירת המחדל לרוב השימושים היא Q4_K_M, ששוקל כ־14.3 גיגה בייט ומאזן בין איכות לנפח. אם יש לכם מספיק זיכרון גרפי של 24 גיגה, קחו את Q6_K או Q5_K_M בשביל איכות טובה יותר. מתחת ל־Q4 עדיף לא לרדת אלא אם אין ברירה.

האם אפשר להריץ אותו רק על המעבד בלי כרטיס מסך?

זה אפשרי טכנית דרך llama.cpp, במיוחד עם גרסאות שתומכות באופטימיזציה כמו Q4_0 או IQ4_NL. יחד עם זאת, מודל של 24 מיליארד פרמטרים ירוץ לאט מאוד על מעבד רגיל, כך שזה לא מתאים לשימוש שדורש מענה מהיר.

איך מריצים

בשביל להריץ אותו כמו שצריך, אתם צריכים לפחות 16 עד 24 גיגה בייט של זיכרון גרפי, תלוי בגרסה שתבחרו. אם יש לכם כרטיס עם 16 גיגה, קובץ כמו Q4_K_M ששוקל קצת מעל 14 גיגה בייט ייכנס פנימה וישאיר מעט מקום להקשר. מי שמתעקש להריץ את הגרסאות המדויקות יותר, סביב Q6 או Q8, כבר יצטרך לפחות 24 גיגה בייט בזיכרון הגרפי או שילוב של זיכרון מערכת עם מעבד, מה שיאט את הקצב משמעותית.

המפתחים ממליצים על כלי כמו LM Studio או הרצה ישירה דרך llama.cpp. אם אתם עובדים על מעבדי ARM או AVX, פורמט Q4_0 תומך באריזה מחדש בזמן ריצה ומשפר ביצועים. אם אין לכם חומרה ייעודית עם מספיק זיכרון מהיר, עדיף פשוט לצרוך מודל כזה דרך ספק צד שלישי במקום להילחם בזמני תגובה איטיים על המעבד.

ollama run hf.co/bartowski/cognitivecomputations_Dolphin-Mistral-24B-Venice-Edition-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

30 קבצים במאגר, 357 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אפשר לשלב אותו במוצרים מסחריים בלי לשלם תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗