GPT
H

Hermes-2-Pro-Llama-3-8B

קוד פתוח

NousResearchllama32024-04-30

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3

גרסה מכווננת של לאמה 3 שמיועדת להפעלת פונקציות והחזרת תשובות במבנה ג'ייסון מדויק. אם אתם בונים סוכנים אוטומטיים וצריכים מודל קומפקטי שמבין סכמות, בשביל זה הוא כאן.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 17.1 GBמשקל הקבצים
  • 2,653הורדות בחודש

מה זה

המודל הזה לוקח את הבסיס המוכר של שמונה מיליארד פרמטרים ומאמן אותו על דאטה ייעודי של הפעלת כלים ופלט מובנה, לצד ניקוי של סט הנתונים הקודם שלהם. במקום להסתפק בצ'אט רגיל, המפתחים הוסיפו לו טוקנים מיוחדים לתגיות של כלים כמו קריאה ותשובה, כדי להקל על הניתוח של הטקסט בזמן אמת. הוא מבוסס על תבנית צ'אט אמ אל, שמוכרת למי שעובד מול הממשקים של אופן אי איי, ומאפשרת להגדיר תפקידים וכללים בצורה ברורה.

במדדי ההערכה הפנימיים שהם בנו יחד עם פיירוורקס, הוא הגיע לדיוק של תשעים אחוז בהפעלת פונקציות ושמונים וארבעה אחוזים במבני ג'ייסון. במבחנים כלליים כמו ג'י פי טי פור אול הממוצע שלו עומד על 72.62, מה שאומר שהיכולות הרגילות שלו לא נשחקו, אבל הערך האמיתי שלו נמצא בעיקר ביכולת לתת פלט טכני שאפשר לחבר ישירות לקוד בלי שיישבר.

מתאים ל

  • סוכן שמפעיל פונקציות

    הוא כולל טוקנים ייעודיים לכלים ומגיע לדיוק גבוה בהמרת שאלות משתמש לקריאות מתאימות.

  • חילוץ מידע לג'ייסון

    המודל אומן להיצמד לסכמות מוגדרות מראש ולהחזיר רק אובייקט תקין בלי טקסט מיותר מסביב.

  • בוט שיחה טכני

    הוא רץ מקומית על חומרה צנועה יחסית ומחזיק יכולות שיחה וקוד סבירות לגודל שלו.

איפה זה נופל

המודל מוגדר רשמית רק באנגלית, כך שאין שום הבטחה או בדיקה לגבי עברית, והוא כנראה ייכשל בניתוח פקודות מורכבות בשפה המקומית. במבחן של אמת ועובדות הוא קיבל 0.41 בלבד במדד הראשון, שזה ציון נמוך שמחייב בדיקה של התוצרים לפני שמסתמכים עליהם. בנוסף, חלון ההקשר שלו מוגבל לשמונת אלפים טוקנים, מה שעלול לחנוק שיחות סוכן ארוכות עם הרבה קריאות לפונקציות עמוסות נתונים.

אותה משפחה

Hermes-2-Pro-Llama-3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד רגיל?

בגרסה המלאה צריך כרטיס מסך ייעודי של עשרים ג'יגה, אבל בגרסאות המכווצות של ארבעה ביט אפשר להסתפק בחמישה ג'יגה זיכרון מסך, מה שמאפשר הרצה סבירה בתוכנות מקומיות.

האם הוא יודע לעבוד בעברית?

הכרטיס מצהיר על אנגלית בלבד. סביר שהוא יזהה עברית בסיסית בגלל אימון הבסיס של לאמה, אבל לא הייתי בונה עליו לפונקציות ופלט מובנה בעברית בלי לבדוק אותו ביסודיות.

מה צריך כדי שהפעלת הפונקציות תעבוד בקוד?

המודל מייצר תגיות מיוחדות בטקסט, ואתם צריכים סקריפט בפייתון שקורא אותן, מריץ את הפונקציה במערכת שלכם ומחזיר את התוצאה כהודעה חדשה לשיחה.

איך מריצים

המשקל המלא של הקבצים עומד על 17.1 ג'יגה בייט בפורמט חצי דיוק, מה שאומר שצריך כרטיס מסך עם לפחות שישה עשר עד עשרים ג'יגה זיכרון כדי לטעון אותו נקי. מי שמחפש לחסוך יכול להוריד גרסת קוונטיזציה של ארבעה ביט, שמסתפקת בערך בחמישה ג'יגה זיכרון מסך ויכולה לרוץ על כרטיסים ביתיים או דרך אל אם סטודיו.

אם אתם צריכים רק צ'אט, להריץ מקומית זה פשוט. לעומת זאת, אם המטרה היא הפעלת פונקציות בסביבת ייצור, תצטרכו לתחזק תשתית שמפרקת את התגיות ומחזירה תשובות מהקוד שלכם, ובמצב כזה שווה לבדוק אם שירות מנוהל חיצוני חוסך לכם את כאב הראש התפעולי.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-2-Pro-Llama-3-8B")
print(pipe("שלום"))

הרישיון

הרישיון הוא הרישיון של לאמה 3. הוא מתיר שימוש מסחרי ומחקר, אבל כפוף לתנאי השימוש והמדיניות של מטא, שכוללים מגבלות שימוש מסוימות ודרישות רישוי מיוחדות לחברות ענק בעלות מאות מיליוני משתמשים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗