GPT
O

ocr_annual_financials

קוד פתוח

tinixaicc-by-nc-4.02026-05-12

  • ocr
  • vietnamese
  • financial-documents
  • annual-report
  • pdf

המאגר מרכז 18,231 דוחות כספיים שנתיים סרוקים ומפוענחים מווייטנאם בין השנים 2015 ל־2025. הוא מיועד למי שבונה מודלים להבנת מסמכים פיננסיים, חילוץ טבלאות ומערכות שאלות ותשובות ייעודיות.

  • 3,728הורדות בחודש
  • 25לייקים

מה זה

הנתונים מכסים 1,491 מניות שנסחרות בווייטנאם ומכילים דוחות כספיים מלאים מטווח של עשור. המאגר מתחלק לארבעה מגזרים עסקיים עיקריים שכוללים בנקים, חברות ניירות ערך, חברות ביטוח ודוחות תאגידיים רגילים המהווים את רוב החומר. הדיווחים מקיפים דוחות מאוחדים, דוחות חברת אם, ביקורות רואי חשבון, הערות מלוות ונספחים שונים.

בפנים תמצאו קבצי PDF מקוריים לצד קבצי טקסט תואמים שהופקו בתהליך זיהוי תווים אופטי תוך שמירה על מבנה המסמך. הצוות סינן מהמאגר מסמכים באנגלית, דוחות קצרים במיוחד ותוצרי סריקה שסבלו משגיאות חמורות, וארגן את הקבצים במבנה היררכי לפי סימול מניה, שנת דיווח ושם הדוח.

מתאים ל

  • בדיקת איכות OCR פיננסי

    השוואת ביצועים של מודלי פענוח על דוחות מורכבים מול קובצי ה־PDF המקוריים.

  • אימון מודלי שפה ומסמכים

    התאמת מודלי ראייה ושפה לחילוץ נתונים מדוחות כספיים וטבלאות סרוקות בווייטנאמית.

  • מערכות RAG לדוחות שוק

    בניית מאגר ידע מבוסס אחזור לצורך מענה על שאלות מתוך עשור של דיווחים עסקיים.

איפה זה נופל

המאגר מוגבל אך ורק לשפה הווייטנאמית, כך שאין בו תועלת ישירה לעיבוד טקסט בעברית או בניתוח דוחות מקומיים. המפרסמים מדווחים על דיוק של 95% בנתונים מספריים ובטבלאות, מה שאומר שחמישה אחוזים מהמספרים שגויים או מעוותים עקב איכות המקור. בנוסף קיימים רעשי סריקה במסמכים מסוימים, ולכן אי אפשר להסתמך עליהם לחישובים קריטיים בלי שכבת בדיקה ותיקוף נוספת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון המוגדר הוא CC BY-NC 4.0 שמונע כל שימוש מסחרי ישיר או עקיף. מותר להשתמש במידע למחקר אקדמי, בדיקות ופיתוח פנימי בלבד.

כמה שטח אחסון צריך כדי לעבוד עם הנתונים?

המאגר כולו תופס כ־194 גיגה בייט. הנפח מורכב משילוב של קובצי PDF מקוריים וקובצי טקסט שהופקו מתוכם עבור 18,231 דוחות.

האם המאגר כולל דוחות בעברית או באנגלית?

לא. המאגר כולל אך ורק דוחות בווייטנאמית מחברות מקומיות. מסמכים באנגלית סוננו והוסרו החוצה במהלך שלב עיבוד הנתונים.

האם הטקסט המפוענח נקי משגיאות?

לא לחלוטין. היוצרים מציינים דיוק של 95% על טבלאות ומספרים, ומתריעים שקיימים רעשי סריקה עקב איכות הדפים המקוריים בחלק מהדוחות.

איך טוענים

המאגר שוקל כ־194 גיגה בייט ומכיל 36,472 קבצים, לכן תצטרכו שטח אחסון משמעותי ותעבורת רשת רחבה כדי להוריד אותו במלואו. הגישה פתוחה ואינה דורשת אישור מיוחד מהיוצרים.

בניגוד למאגרים טבלאיים רגילים שנטענים בשורה אחת דרך הספרייה, כאן עובדים ישירות מול מערכת הקבצים. הנתונים מחולקים לשתי תיקיות בסיס, אחת לקובצי המקור בפורמט PDF והשנייה לקובצי טקסט נקיים בסיומת TXT המקודדים ב־UTF-8. כדי לרוץ עליהם יש לסרוק את עץ התיקיות באמצעות סקריפט מקומי, לחלץ את סימול המניה והשנה מתוך נתיב הקובץ, ולקרוא את התוכן הטקסטואלי לזיכרון תוך התעלמות משגיאות קידוד נקודתיות.

from datasets import load_dataset

ds = load_dataset("tinixai/ocr_annual_financials")

הרישיון

הרישיון הוא CC BY-NC 4.0 שמתיר שימוש למחקר, לימוד ובדיקות פנימיות בלבד, ומחייב מתן קרדיט למפרסמים. נאסר כל שימוש מסחרי, מה שפוסל אימון מודלים שיוטמעו במוצרים מסחריים או מכירת הנתונים ונגזרותיהם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗