GPT
D

dolphin-2.9-llama3-8b-GGUF

קוד פתוח

QuantFactoryother2024-04-21

  • gguf
  • generated_from_trainer
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF לא מיושרת של לאמה 3 בגודל 8 מיליארד פרמטרים. היא תענה על כמעט כל הוראה שתתנו לה בלי לחנך אתכם בדרך.

  • 67.7 GBמשקל הקבצים
  • 2,524הורדות בחודש
  • 60לייקים

מה זה

מדובר בהמרה של דולפין 2.9 לפורמט שמתאים להרצה דרך llama.cpp. המפתחים לקחו את המודל הבסיסי ואימנו את כל המשקולות שלו מחדש על כל הפרמטרים, אבל הסירו מדאטה-סט האימון חסימות יישור והטיות מכוונות כדי להפוך אותו לצייתן במיוחד. מעבר לשיחה רגילה ולכתיבת קוד, הוסיפו לו תמיכה בסיסית בהפעלת פונקציות וביכולות של סוכנים.

תוצאות האימון מראות שהפסד הוולידציה ירד מנקודת פתיחה של 1.1064 עד לשפל של 0.6168 בסביבות האפוק השני, ואז התייצב ועלה מעט לאזור 0.66 באפוק השלישי. זה מעיד על כוונון יעיל סביב נתוני השיחה, עם סימנים קלים להתחלת התאמת יתר בסוף הריצה של 6105 הצעדים.

מתאים ל

  • הפעלת פונקציות וסוכנים

    הוא כולל תמיכה מובנית בקריאות לפונקציות ויכולות סוכן, ורץ מקומית דרך llama.cpp בלי שירותים חיצוניים.

  • מחקר וניסויי התנהגות

    מאחר שהוא נקי מחסמי יישור, אפשר לבחון תגובות גולמיות של המודל ללא סינונים מלאכותיים של חברות הענן.

  • עוזר פיתוח מקומי

    הוא אומן על משימות תכנות ושיחה, ומאפשר עבודה על קוד רגיש שאי אפשר להוציא לרשת.

איפה זה נופל

המאפיין המרכזי כאן הוא היעדר מוחלט של יישור, והיוצר מצהיר מפורשות שהמודל ישתף פעולה גם עם פניות לא אתיות ויענה עליהן בלי בעיה. אם אתם חושפים אותו למשתמשי קצה בלי לבנות שכבת סינון ובקרה משלכם, אתם מקבלים כלי שאין לו שום מעצורים מובנים. בנוסף, חלון ההקשר באימון הוגבל לאורך רצף של 4k בלבד למרות שהבסיס תומך ב־8k, כך שהוא עלול להתבלבל בטקסטים ארוכים.

שאלות
נפוצות

האם המודל מתאים לחשיפה ישירה מול לקוחות?

לא בלי שכבת בטיחות חיצונית שאתם מפתחים בעצמכם. המפתח מבהיר שהמודל צייתן לחלוטין ויענה לכל הוראה בלי סינון, ולכן חשיפה לא מבוקרת שלו למשתמשי קצה היא סיכון שלכם בלבד.

איזה מבנה פנייה צריך לשלוח אליו?

הוא אומן לעבוד עם תבנית ChatML בלבד. שימוש במבנה אחר יפגע בדיוק של התשובות וביכולת שלו לנהל שיחה תקינה.

איך מריצים

המשקל הכולל בריפו מגיע ל־67.7 ג'יגה-בייט שמחולקים בין 16 קבצים, שזה למעשה מגוון רמות כימוס שונות ולא קובץ בודד שצריך להוריד במלואו. בשביל להריץ גרסת כימוס ממוצעת של מודל 8B תצטרכו מחשב מקומי עם כרטיס מסך שיש לו לפחות 8 עד 12 ג'יגה זיכרון גרפי, או מספיק זיכרון מערכת להרצה על המעבד.

המודל דורש פורמט פניות מסוג ChatML כדי להגיב נכון. אם אתם לא צריכים ספציפית מודל מקומי נטול חסימות או שאין לכם חומרה שמסוגלת לתת קצב טוקנים מהיר, שירותי ענן עם API מסחרי יהיו פשוטים יותר לתחזוקה שוטפת.

ollama run hf.co/QuantFactory/dolphin-2.9-llama3-8b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כחריג וכפוף ישירות לרישיון הקהילתי של מטא עבור לאמה 3. היוצר מתיר כל שימוש, כולל שימוש מסחרי, כל עוד אתם עומדים בתנאים של מטא, אך חשוב לקחת בחשבון שהאימון כלל מידע שנוצר באמצעות GPT-4.

הרישיון המלא בעמוד המודל ↗