GPT
D

dolphin-2.9.2-qwen2-7b-gguf

קוד פתוח

dphnרישיון לא דווח2024-05-24

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסה מכווצת של מודל פתוח מבוסס Qwen2 שמיועדת להרצה מקומית. הוא נבנה עבור מי שמחפש חופש פעולה ביצירת טקסט בלי מעצורים שמובנים במודלים מסחריים.

  • 107 GBמשקל הקבצים
  • 2,696הורדות בחודש
  • 46לייקים

מה זה

מדובר בכימות של dolphin-2.9.2-qwen2-7b שבוצע באמצעות llama.cpp עם imatrix, במטרה לשמר דיוק מרבי גם ברמות דחיסה אגרסיביות. המודל מבוסס על שושלת דולפין של cognitivecomputations, שידועה בכך שהיא מסירה מגבלות צנזורה ומאפשרת למודל לענות על הוראות באופן ישיר וחופשי יותר ממה שמקובל במודלים מסחריים רגילים.

הבסיס כאן הוא ארכיטקטורת Qwen2 בגודל שבעה מיליארד פרמטרים, מה שנותן נקודת פתיחה חזקה מאוד להבנת שפה וקוד ביחס לגודל. הכימות שמופיע כאן מחלק את המודל לגרסאות שונות כדי לאפשר לכם לבחור בדיוק את האיזון הנכון בין תפיסת זיכרון לבין איכות הפלט הסופית על החומרה שלכם.

מתאים ל

  • הרצה מקומית על מחשב יחיד

    הוא מגיע בפורמט GGUF קל לטעינה שנכנס גם למחשבים אישיים עם כרטיס מסך בסיסי.

  • סביבות פיתוח לא מצונזרות

    סדרת דולפין בנויה לענות על כל פקודה ישירות בלי להפעיל מנגנוני סירוב עצמיים.

  • ניסויי שפה ללא חיבור רשת

    המודל פועל במלואו על החומרה המקומית בלי לשלוח מידע החוצה ובלי עלויות לפי טוקן.

איפה זה נופל

הכרטיס לא מציג מבחני ביצועים מסודרים, ציוני בנצ'מרק או נתונים על יכולות בשפות שאינן אנגלית. בנוסף, קובצי IQ אינם נתמכים בסביבת Vulkan, והם רצים לאט יותר על מעבדים רגילים ועל שבבי אפל בהשוואה לגרסאות K הרגילות. לפני שמשלבים אותו במערכת אמיתית, חייבים לבדוק עצמאית שהוא אכן עומד בדרישות התוכן והדיוק שלכם.

אותה משפחה

dolphin-2.9.2-qwen2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מהרשימה?

אם אתם לא רוצים להסתבך, גרסת Q4_K_M או Q5_K_M היא נקודת התחלה טובה. היא שומרת על איזון מצוין בין איכות הטקסט לבין צריכת זיכרון סבירה על רוב כרטיסי המסך המודרניים.

באיזה פורמט צריך להזין את הפניות?

המודל דורש את מבנה ChatML הרגיל של Qwen2. עוטפים את ההוראות בתגיות של system, user ו־assistant כדי לקבל תשובות עקביות ותקינות.

איך מריצים

מורידים קובץ בודד בפורמט GGUF בעזרת huggingface-cli ומריצים אותו ישירות מעל llama.cpp או תוכנות כמו LM Studio. כדי לקבל ביצועים מהירים באמת, עדיף לבחור קובץ שמשקלו קטן בגיגהבייט או שניים מסך זיכרון ה־VRAM של כרטיס המסך שלכם, כך שכל המשקלים יישבו ישירות על ה־GPU.

אם אין לכם כרטיס עם מספיק זיכרון, אפשר לחלק את העומס בין ה־VRAM לזיכרון ה־RAM של המחשב. מי שמשתמש בכרטיסי Nvidia עם cuBLAS או ב־AMD עם rocBLAS יכול לבחור בגרסאות ה־imatrix הנמוכות כמו IQ3_M כדי לחסוך מקום, בעוד שמשתמשי מעבד רגיל או Metal במק יעדיפו לרוב קובצי K-quants קלאסיים כמו Q4_K_M או Q5_K_M כדי לא לפגוע במהירות הריצה.

ollama run hf.co/dphn/dolphin-2.9.2-qwen2-7b-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המאגר הזה לא דווח. מבחינה משפטית מדובר בסיכון, כי אין אישור כתוב לשימוש מסחרי או הפצה בתוך מוצר. אם אתם בונים שירות לחברה או ללקוחות, אי אפשר להסתמך עליו בלי לברר קודם את תנאי הרישיון של מודל המקור המקורי.

הרישיון המלא בעמוד המודל ↗