GPT
H

huginn-0125

קוד פתוח

tomg-group-umdapache-2.02025-01-08

  • transformers
  • safetensors
  • huginn_raven
  • text-generation
  • code

מודל מחקרי שמריץ שכבות באופן מחזורי ומאפשר לקבוע כמה זמן מחשב להשקיע בכל טוקן. מתאים בעיקר למי שרוצה לבחון חשיבה לטנטית בלי להישען על שרשראות טקסט רגילות.

  • 3.9Bפרמטרים
  • 14.6 GBמשקל הקבצים
  • 27,148הורדות בחודש
  • 307לייקים

מה זה

במקום לעבור במסלול קבוע של שכבות קדימה, המודל הזה מחזיק בלוק חוזר של 1.5 מיליארד פרמטרים שרץ שוב ושוב על המצב הפנימי. סך הפרמטרים מגיע לכמעט 4 מיליארד, אבל בזמן הריצה קובעים את עומק החישוב לפי פרמטר בשם num_steps. מתחת לארבעה צעדים התוצאות גסות וחלשות, ובין ארבעה לשישים וארבעה צעדים הביצועים במשימות היגיון וקוד משתפרים בהתמדה. מעבר לשישים וארבעה צעדים המפתחים מדווחים שאין שיפור נוסף, כך שאין טעם לבזבז כוח עיבוד מיותר.

הוא אומן על 800 מיליארד טוקנים בלבד, שזה מעט מאוד ביחס למודלים מודרניים. למרות זאת, הוא כולל תמיכה מובנית בפורמט שיחה ישירות מאימון הבסיס ללא כוונון עדין נוסף, לצד מנגנונים שמאפשרים לו לעצור את החישוב מוקדם בכל טוקן ברגע שהתחזית מתייצבת.

מתאים ל

  • מחקר על חישוב דינמי

    מאפשר לשלוט במספר צעדי הרקורסיה לכל טוקן ולבחון מדדי עצירה מוקדמת כמו יציבות ארגמקס.

  • בדיקת חשיבה לטנטית בקוד

    מבצע משימות היגיון ותכנות בלי לייצר פלט טקסטואלי ארוך של שרשרת מחשבה.

  • ניסויי דחיסת מטמון

    כולל תמיכה מובנית בדחיסת שכבות מפתח ערך לאורך החזרות כדי לחסוך בזיכרון בזמן ריצה.

איפה זה נופל

המודל אומן במשך 47,000 צעדים בלבד עם קצב למידה קבוע ועל תערובת נתונים שלא נבדקה לעומק. 800 מיליארד טוקנים הם תקציב אימון זעיר ביחס לסטנדרט התעשייתי. הוא תומך באנגלית בלבד ואינו מכיר עברית מעבר לתווים בודדים. בנוסף, מימושי המטמון המיוחדים שלו נוטים להישבר בעדכוני גרסאות של transformers, מה שהופך אותו ללא יציב לסביבות ייצור.

שאלות
נפוצות

האם כדאי להגדיר יותר מ־64 צעדי חישוב בריצה?

לא. המדידות של יוצרי המודל מראות שהאיכות עולה עד 64 צעדים, ומעבר לזה אין שום שיפור בתוצאות, אלא רק בזבוז זמן וחישוב.

האם המודל תומך בעברית?

המודל הוגדר ואומן באנגלית בלבד. הוא לא עבר אימון על טקסט עברי ולא מיועד לעיבוד שפות שאינן אנגלית.

למה קובצי המשקלים כבדים יחסית לגודל הפרמטרים?

בגלל תקלה טכנית בהעלאת המודל לשרתים, שכבת ה־embedding נשמרה פעמיים במקום פעם אחת, מה שנפח את הקבצים ל־14.6 גיגה בייט.

איך מריצים

כדי להריץ אותו צריך לתת לו לרוץ בקוד מרוחק עם trust_remote_code, כי הוא משתמש במימוש מטמון ייעודי בשם HuginnDynamicCache. הקבצים שוקלים כמעט 15 גיגה בייט בגלל באג ששמר שכבת שיבוץ כפולה בהעלאה, אבל הריצה עצמה דורשת bfloat16 ומסתדרת על כרטיס מסך בודד עם 16 עד 24 גיגה בייט זיכרון, תלוי באורך ההקשר ובכמות צעדי החישוב.

הוא לא מיועד לשירות דרך שרתי הסקה סטנדרטיים כמו vLLM בלי התאמות קוד עמוקות. אם המטרה היא סתם לקבל תשובות מהירות או לסגור פינה במוצר, עדיף להשתמש ב־API של מודל קטן ומסחרי. הריצה המקומית כאן משתלמת רק למי שרוצה לשלוט ישירות בכמות צעדי הרקורסיה או לבדוק אסטרטגיות עצירה מוקדמת.

from transformers import pipeline

pipe = pipeline("text-generation", model="tomg-group-umd/huginn-0125")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו ברישיון Apache 2.0. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗