GPT
H

Hermes-3-Llama-3.2-3B

קוד פתוח

NousResearchllama32024-12-03

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3

גרסה מכווננת של לאמה 3.2 בגודל קטן, שמיועדת להרצה מקומית בלי לבלוע משאבים. היא מתבלטת בעיקר ביכולת להחזיר פלט מובנה ולהפעיל פונקציות בלי מעטפת כבדה.

  • 3.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.0 GBמשקל הקבצים
  • 2,715הורדות בחודש

מה זה

מדובר בכיוונון מלא על בסיס Llama-3.2 3B מבית Nous Research, שמכוון לתת שליטה חזקה יותר בהנחיות מערכת מאשר מודל הבסיס המקורי. המודל משתמש בפורמט ChatML, מה שמאפשר להגדיר תפקידים ברורים בשיחה ולהתממשק בקלות לפייפליינים שבנויים בסגנון של OpenAI.

המטרה העיקרית פה היא התנהגות כסוכן עצמאי, עם דגש על יצירת קוד, קריאות לפונקציות ופליטת JSON לפי סכמה מוגדרת מראש. מבחינת מבחני ביצועים, הוא קיבל 64.00 ב־GPT4All, ציון של 43.76 ב־BigBench ורק 34.36 ב־AGIEval. התוצאה הנמוכה ב־AGIEval מראה שזה עדיין מודל קטן, והוא מתקשה במשימות היגיון מורכבות ורב שלביות שמצריכות ידע אקדמי או אנליטי כבד.

מתאים ל

  • חילוץ מידע למבנה נתונים

    הוא יודע לייצר JSON לפי סכמה מדויקת שמוגדרת בהנחיית המערכת.

  • הפעלת כלים מקומית

    המבנה שלו אומן במיוחד לקרוא לפונקציות ולהחזיר ארגומנטים נקיים.

  • אינטראקציות שיחה מותאמות

    התמיכה בפורמט ChatML מאפשרת שליטה חזקה באופי ובהנחיות המודל.

איפה זה נופל

המודל אומן ומוגדר לשפה האנגלית בלבד, ולכן הוא לא מתאים לעיבוד שפה טבעית בעברית ללא כיוונון נוסף. מעבר לכך, התוצאה במבחן AGIEval, שעומדת על 34.36 בלבד, מעידה על חולשה בפתרון בעיות סבוכות. מי שינסה להשתמש בו לניתוח טקסט מעמיק או לקבלת החלטות קריטיות באוטומציות מורכבות ייתקל בהזיות ובחוסר דיוק.

אותה משפחה

Hermes-3-Llama-3.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. פקודות בעברית עלולות להניב פלטים משובשים או חלקיים, ולא מומלץ להסתמך עליו למשימות בשפה המקומית.

איך מחברים אותו לקוד של פונקציות?

מגדירים את חתימת הפונקציה בתוך הודעת ה־system לפי הפורמט של Nous Research. המודל מחזיר תגית ייעודית עם שם הפונקציה והמשתנים, הקוד שלכם מריץ אותה, ומחזיר לו את התשובה תחת תפקיד tool להמשך התשובה.

איך מריצים

המשקל הכולל של הקבצים הוא 6.0 ג'יגה בייט בדיוק bfloat16, כך שאפשר להריץ אותו ישירות דרך ספריית transformers או להרים שרת מקומי עם פקודת vLLM פשוטה. אם רוצים לחסוך עוד יותר בזיכרון, קיימות גרסאות מכווצות בפורמט GGUF בעמוד נפרד של היוצרים, שיכולות לרוץ בקלות על מעבד רגיל או מחשב נייד בלי כרטיס גרפי ייעודי.

להרים אותו לבד משתלם בעיקר אם רוצים פרטיות מוחלטת, שליטה באופרציות מקומיות, או שחייבים אפס עלויות שוטפות על קריאות רשת. לעומת זאת, אם המוצר שלכם דורש מענה מהיר להמוני משתמשים במקביל ואין לכם שרת ייעודי זמין, קריאה לשרת ענן מנוהל תחסוך לכם תחזוקת תשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-3-Llama-3.2-3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 3 של מטא. הוא מתיר שימוש מסחרי, אך כולל מגבלות ספציפיות של מטא, כמו דרישה לקבלת אישור מיוחד אם המוצר שלכם מגיע ליותר מ־700 מיליון משתמשים פעילים בחודש, ואיסור להשתמש בפלט כדי לאמן מודלים מתחרים שאינם מבוססי לאמה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗