GPT
H

Hermes-3-Llama-3.2-3B-GGUF

קוד פתוח

NousResearchllama32024-12-11

  • transformers
  • gguf
  • Llama-3
  • instruct
  • finetune

התאמה מלאה של Llama 3.2 הקטן שמיועדת להפעלת כלים ושיחות מובנות. הוא נותן מענה מצוין למי שמחפש שליטה מדויקת בפלט בלי להחזיק שרת כבד.

  • 9.7 GBמשקל הקבצים
  • 5,412הורדות בחודש
  • 75לייקים

מה זה

מדובר בכוונון מלא של המודל Llama-3.2 3B מבית NousResearch, שמתמקד בציות להוראות, משחקי תפקידים ושיחות מרובות שלבים. המודל בנוי סביב פורמט ChatML, מה שאומר שהוא מקבל פרומפטים של מערכת בצורה ישירה ומאפשר לכוון את ההתנהגות שלו ברמת דיוק גבוהה בהרבה מגרסאות הבסיס של מטא. הוא הותאם ספציפית לייצור JSON לפי סכמה מוגדרת ולהפעלת פונקציות באמצעות תגיות ייעודיות.

במבחני הביצועים הוא מקבל 64.00 ב־GPT4All, ציון של 34.36 ב־AGIEval ו־43.76 ב־BigBench. המספרים האלה מראים שהוא מתמודד יפה עם משימות כלליות ומדביק מודלים מסדרת Llama-3.1 Instruct, אבל בגלל הגודל הפיזי שלו הוא מוגבל בהסקה מורכבת ומתאים בעיקר למשימות ניתוב, שיחה ועיבוד תחום מוגדר.

מתאים ל

  • הפעלת פונקציות וכלים

    הוא כולל מבנה תגיות ייעודי להמרת פקודות משתמש לקריאות API ועיבוד התשובות.

  • חילוץ מידע למבנה JSON

    מאומן לציית לסכמות מוגדרות מראש ולהחזיר אך ורק אובייקט תקין ללא טקסט עודף.

  • סוכן שיחה מקומי

    תומך בפורמט ChatML להגדרה הדוקה של תפקידים ואישיות בתוך אפליקציות שרצות על המכשיר.

איפה זה נופל

זה עדיין מודל של 3 מיליארד פרמטרים. הציון שלו ב־AGIEval עומד על 34.36, תוצאה שממחישה את הקושי שלו בלוגיקה קשה, מתמטיקה או פתרון בעיות סבוכות. בנוסף, המודל אומן ותועד באנגלית בלבד. אם תפנו אליו בעברית או תבקשו ממנו לחלץ שדות מורכבים בטקסט מקומי, הוא עשוי להחזיר שגיאות תחביר או לאבד את מבנה ה־JSON הנדרש, ולכן חובה לבדוק אותו על הנתונים שלכם לפני שסומכים עליו בתהליך אוטומטי.

אותה משפחה

Hermes-3-Llama-3.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעיבוד טקסטים בעברית?

התיעוד והאימון שלו מוגדרים לאנגלית בלבד. הוא עשוי לקרוא מילים בעברית, אבל הוא לא אומן על השפה ולא הייתי מסתמך עליו למשימות חילוץ או שיחה בעברית בלי לבדוק אותו קודם בצורה קפדנית.

איך משלבים אותו בקוד להפעלת פונקציות?

המודל מחזיר תגית מיוחדת של קריאת כלי עם שם הפונקציה והמשתנים שלה. הקוד שלכם צריך לקרוא את התגית, להריץ את הפונקציה במערכת, ולהחזיר לו את התוצאה בתור תגית תגובה כדי שימשיך את השיחה.

איך מריצים

החבילה כוללת קובצי GGUF במשקל כולל של 9.7 גיגה-בייט שמחולקים לשישה קבצים. זה אומר שאפשר לטעון גרסה מכווצת שלו ישירות על מחשב נייד פשוט, מעבד סביר בלי מאיץ ייעודי, או כרטיס גרפי ביתי עם מעט מאוד זיכרון, ועדיין לקבל קצב תגובה מהיר. הוא נתמך בספריית transformers ומוכן להרצה גם דרך vLLM בפקודת שרת אחת.

אם אתם צריכים רק לקבל מענה טקסטואלי מדי פעם בלי תלות מקומית, אין סיבה להחזיק תשתית, עדיף להשתמש ב־API מרוחק. הרצה עצמית של המודל הזה מתאימה כשאתם חייבים שליטה מוחלטת במידע, אפס עלות לפי טוקן, וזמני השהיה קצרים בלולאות שמפעילות קוד מקומי.

ollama run hf.co/NousResearch/Hermes-3-Llama-3.2-3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון llama3 של מטא. הרישיון מאפשר שימוש מסחרי חופשי לרוב המפתחים והעסקים הקטנים, כל עוד עומדים במגבלות המקוריות של מטא, כולל תנאי השימוש המקובלים ומגבלת היקף המשתמשים הגבוהה מאוד שמוגדרת ברישיון הבסיס.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗