GPT
O

ocr

קוד פתוח

uv-scriptsרישיון לא דווח2025-07-28

  • uv-script
  • ocr
  • extraction
  • vision-language-model
  • document-processing

זה לא מאגר תמונות אלא אוסף של 57 קבצים וסקריפטים להרצת מודלי זיהוי טקסט שונים. המטרה כאן היא לקחת דאטהסט תמונות קיים, להריץ עליו מודל, ולקבל עמודת מרקדאון או מידע מובנה.

  • 2,478הורדות בחודש
  • 159לייקים

מה זה

במקום טבלאות נתונים או דוגמאות אימון, המאגר מציע קטלוג סקריפטים עצמאיים בפורמט uv. כל סקריפט מיועד למודל מסוים, קורא תמונות מתוך דאטהסט קיים בעמודת התמונות, ומייצר דאטהסט פלט חדש שבו נוספה עמודת טקסט בשם markdown. חלק מהכלים מבצעים חילוץ מובנה וממלאים סכמת JSON מוגדרת לפי דרישה, ואילו כלי כמו pp-doclayout מחלץ תיבות תוחמות וסוגי אזורים בדף ללא פענוח הטקסט עצמו.

המבנה כולל סקריפטים שרצים במצב אצווה, גרסאות שרת ייעודיות שמפעילות vLLM ברקע לקבלת תפוקה גבוהה, וקבצים שמחוברים לספריית saturate לתמיכה בעבודה רציפה והתאוששות מתקלות. אין כאן נתוני מקור שנאספו מדפי אינטרנט או מסמכים, אלא כלי אוטומציה שמקבלים נתונים שלכם ורצים ישירות על תשתית Hugging Face Jobs או שרתי ענן.

מתאים ל

  • המרת תמונות מסמכים למרקדאון

    הרצת סקריפט אצווה על דאטהסט תמונות קיים והוספת עמודת טקסט מעוצב לקבצי היעד.

  • חילוץ מידע מובנה לפי סכמה

    הפעלת סקריפטים כגון NuExtract3 או lift כדי למלא קובצי JSON מתמונות מסמכים או עמודי PDF.

  • זיהוי פריסה ואזורי מסמך

    שימוש ב־pp-doclayout להפקת תיבות תוחמות עבור פסקאות, טבלאות ותמונות ללא חילוץ הטקסט.

איפה זה נופל

המאגר מכיל קוד בלבד, כך שאיכות התוצאות, התמיכה בשפות שונות והדיוק תלויים לחלוטין במודל הנבחר. מסמכים סרוקים קשים או בעלי פגמים גורמים לחלק מהמנועים להזות טקסט, במיוחד בעיבוד מסמכים מרובי עמודים שבהם נמצא כי SGLang יציב יותר לעומת vLLM. סקריפטים מסוימים רגישים לגרסאות מדויקות של תלויות, למשל דגמי Qwen מסוימים שמפיקים פלט שגוי לחלוטין בגרסאות vLLM שאינן מקובעות, ולכן חובה לבדוק את התנהגות המודל הנבחר על מדגם קטן.

שאלות
נפוצות

האם הדאטהסט כולל תמונות וטקסטים שאפשר להוריד?

לא. המאגר מכיל 57 קבצים שכוללים סקריפטי פייתון, קובצי תיעוד ודוגמאות הרצה. הוא מיועד לעיבוד דאטהסטים קיימים שלכם ולא מכיל מסמכים משלו.

האם מותר להשתמש בכלים האלה במוצר מסחרי?

למאגר הסקריפטים עצמו לא הוגדר רישיון רשמי. מעבר לכך, כל סקריפט מפעיל משקולות מודל שונות, כך שיש דגמים ברישיון חופשי לצד דגמים עם רישיונות מגבילים שאוסרים שימוש מסחרי מסוים.

האם יש תמיכה בזיהוי טקסט בעברית?

המאגר אינו מתחייב לאיכות בעברית. הכיסוי הלשוני תלוי במודל שאתם בוחרים להריץ, כאשר מודלים מסוימים בקטלוג כמו Tesseract, Surya או Qianfan מצהירים על תמיכה במגוון רחב של שפות אך נדרשת בדיקה שלכם.

איזו חומרה צריך כדי להריץ את העיבוד?

הדרישות משתנות לפי גודל המודל והסקריפט. כלי בסיסי כמו Tesseract יכול לרוץ על מעבד רגיל, בעוד שמודלים של מיליארדי פרמטרים מבוססי vLLM דורשים מאיץ גרפי מתאים כמו L4 או A100.

איך טוענים

טוענים ומריצים את הסקריפטים ישירות דרך הפקודה hf jobs uv run בהפניה לקישור הקובץ הגולמי במאגר. ברירת המחדל מצפה לעמודת קלט בשם image ומייצרת עמודה בשם markdown, אך ניתן לשנות שמות אלו בדגלים ייעודיים. חובה להעביר טוקן גישה של Hugging Face כדי לשמור את התוצאות למאגר היעד. מודלים רבים מבוססים על מנוע vLLM ודורשים מאיץ גרפי, ובמקרים של שגיאות הידור CUDA יש להריץ אותם על תמונת דוקר ייעודית של vLLM שמכילה את כלי הפיתוח הנחוצים.

from datasets import load_dataset

ds = load_dataset("uv-scripts/ocr")

הרישיון

למאגר עצמו לא דווח רישיון ברמת המאגר. בנוסף, כל סקריפט טוען מודל אחר עם תנאי שימוש משלו. חלק מהמודלים מופצים ברישיון Apache 2.0 או MIT שמאפשר שימוש מסחרי, אך אחרים כוללים תנאים מגבילים כמו רישיון OpenRAIL מותאם שמגביל שימוש עסקי מעל סף הכנסות מסוים, או רישיונות דוגמת Hunyuan שמחריגים אזורים גיאוגרפיים מסוימים. חובה לבדוק את רישיון המודל הספציפי שאתם מריצים.

הרישיון המלא ב־Hugging Face ↗