GPT
H

halt-cot

קוד פתוח

yass4mit2026-07-11

  • transformers
  • halt_cot
  • text-generation
  • chain-of-thought
  • reasoning

שיטה לעצירה מוקדמת של שרשראות חשיבה כדי לחסוך טוקנים וזמן חישוב. המנגנון מודד אנטרופיה על פני תשובות אפשריות ועוצר את ההסקה ברגע שהוודאות מגיעה לסף שהגדרתם.

  • 286 KBמשקל הקבצים
  • 67הורדות בחודש
  • 205לייקים

מה זה

לא מדובר במודל שפה עם משקולות מאומנות, אלא במימוש קוד שנארז תחת ספריית transformers. החבילה הזו שוקלת 286 קילובייט בלבד ומכילה לוגיקה שמפקחת על תהליך ההסקה של מודלים אחרים. בכל צעד חשיבה, המנגנון בודק את התפלגות ההסתברויות עבור קבוצת תשובות מוגדרת מראש ומחשב את אנטרופיית שאנון. ברגע שהאנטרופיה יורדת מתחת לסף מסוים, הייצור נעצר והתשובה המובילה מוחזרת מיד.

המטרה כאן היא לחתוך את הפטפוט המיותר שמודלים נוטים לייצר כשהם כבר הגיעו למסקנה הנכונה. במקום לתת למודל למשוך שרשרת חשיבה ארוכה וסתמית עד סוף מגבלת הטוקנים, עוצרים אותו בדיוק כשההתפלגות מתייצבת. המחבר מציע ספי עצירה שונים לפי אופי המשימה, כמו 0.5 עד 0.7 לבעיות מספריות, 0.7 לבחירה מרובה ו־0.8 לשאלות כן ולא.

מתאים ל

  • קיצור שרשראות במתמטיקה

    עצירת תהליך הפתרון ברגע שהמודל מתכנס למספר מתוך טווח מועמדים מוגדר, כדי לחסוך טוקנים.

  • שאלות כן ולא

    מדידת אנטרופיה בינארית פשוטה שמאפשרת לחתוך את הנימוק ברגע שהכרעה מתקבלת בוודאות מספקת.

  • מבחני בחירה מרובה

    מעקב אחרי הסתברות האופציות האפשריות בכל צעד הסקה ועצירה מיידית כשאחת האפשרויות מובילה.

איפה זה נופל

המגבלה הכי משמעותית היא החובה להגדיר מראש קבוצה של תשובות מועמדות. אם אתם פותרים בעיה מתמטית שבה התשובה יכולה להיות כל מספר, או משימה עם תשובה פתוחה, תצטרכו לנחש או לייצר מראש טווח ערכים כדי שהמערכת תוכל לחשב עליהם אנטרופיה. בנוסף, בחירת סף לא נכונה עלולה לעצור את המודל מוקדם מדי כשהוא טועה בביטחון, או לא לעצור אותו בכלל ולבטל את כל היתרון של החיסכון.

שאלות
נפוצות

האם צריך להוריד משקולות של מודל ענק כדי להשתמש בזה?

לא מורידים פה משקולות של מודל שפה. המאגר מכיל רק קוד פייתון ששוקל פחות ממגה־בייט, ואתם מחברים אותו למודל שפה קיים שכבר רץ אצלכם.

האם השיטה עובדת עם כל שאלה של טקסט חופשי?

לא. המנגנון מחייב סט מוגדר של תשובות מועמדות כדי לחשב הסתברויות ואנטרופיה, ולכן הוא מתאים בעיקר לבחירה מרובה, שאלות בינאריות או שאלות עם טווח תשובות צפוי.

איך מריצים

מתקינים את החבילה ישירות מהקוד ומריצים אותה מעל מודל שפה קיים לבחירתכם, למשל מודלים ממשפחת Qwen. הריצה עצמה לא דורשת משאבים מעבר למה שהמודל שבחרתם צורך, כי המעטפת של HALT-CoT רק מחשבת אנטרופיה על גבי הלוגיטים בכל צעד. הקוד כולל ממשק פייתון, ממשק שורת פקודה, ואפליקציית Gradio.

אם אתם עובדים עם ספקי צד שלישי שחושפים רק טקסט סופי ולא מחזירים לוגיטים מלאים על מועמדים, השיטה הזו לא תעבוד. אתם חייבים גישה ישירה למודל ולמנגנון יצירת הטוקנים, בין אם מקומית ובין אם על שרת עצמאי שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="yass4/halt-cot")
print(pipe("שלום"))

הרישיון

הקוד מופץ תחת רישיון MIT. מותר להשתמש בו באופן חופשי לכל מטרה, כולל מוצרים מסחריים וקוד סגור, בלי תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗