מפגש מחקר — מדעי הרוח הדיגיטליים

שחזור מגילות מדבר יהודה באמצעות AI

מודלים לשוניים בעברית לפענוח לקונות בקומראן וכלי עזר מוסבר לחוקרים

שמוליק כהן
הרקע והמוטיבציה

האתגר: שחזור פערים פיזיים (לקונות)

  • היקף הפגיעה במקורות: מגילות קומראן סבלו מנזקי זמן, לחות וריקבון. מילים שלמות ואף פסקאות חסרות מהקלף.
  • קנה המידה של השחזור: הקורפוס הנקי שלנו מתעד 27,814 אתרי לקונה ב־736 מגילות לא־מקראיות. אותיות ששוחזרו בסוגריים מרובעים אינן נשמרות כטקסט אימון.
  • מטרת המערכת: פיתוח כלי עזר מסייע (Assistive Tool) המציע רשימה מדורגת (Top-K) של מועמדים לשוניים, ולא מנחש אוטומטי עיוור.

שחזור ידני מול ממוחשב

שחזור ידני מבוסס על היכרות רחבה של החוקר עם אוצר המילים וסגנון המגילה, ועל מדידה פיזית של חלל הפער על גבי הקלף.

מודל שפה מתקדם מסוגל להציע עדות סמנטית ותחבירית מקיפה מכלל הטקסטים ששרדו, ולשפר את איכות ההצעות משמעותית.

שיטות מחקר

בניית מתודולוגיה קשיחה ללא "דליפות"

  • נטרול "הטיית המקרא" (The Canon Effect): מודלים מגיעים לתוצאות גבוהות במגילות מקראיות בין היתר בזכות חשיפה לטקסט הקנוני. כדי למדוד הכללה לשונית נקייה יותר, החרגנו את המקרא ואימנו והערכנו על מגילות לא־מקראיות בלבד.
  • חלוקת נתונים נקייה (No-Leak Scroll Split): אימון ומבחן מופרדים ברמת המגילה השלמה (Scroll-Level). אין מצב שקטע מאותה מגילה נכנס גם לאימון וגם למבחן (מניעת זליגה לא מכוונת של טקסטים).
  • חלון הקשר מורחב (Context Window): הגדרת חלון ההקשר ל-40 מילים מכל צד של הלקונה (במקום 20), מה ששיפר באופן עקבי את דיוק השחזור בלקונות בינוניות וארוכות.

למה חלוקה ברמת המגילה היא קריטית?

מכיוון שהמגילות מכילות כפילויות רבות וקטעים חופפים, חלוקת משפטים אקראית רגילה (Sentence-level Split) גורמת לדליפת טקסט ישירה בין סט האימון לסט המבחן.

חלוקה ברמת Scroll-level מבטיחה הערכת הכללה יציבה ואמיתית על מגילות שלא נראו מעולם.

יושרה מדעית ובקרה

בדיקות תקינות ואימות מורפולוגי

  • בדיקת זליגה (Split Leakage): הרצת סקריפט ולידציה המאשר כי סט האימון והמבחן מופרדים לחלוטין ברמת הספר והמגילה (מפגש קבוצות = 0).
  • איטום מסיכה (Masking Integrity): וידוא שהמילים המשוחזרות מוסתרות במלואן בטנזור הקלט ולא דולפות דרך מפות הטוקנייזר.
  • אימות ברמת חיבור ספרותי (Composition Split): החרגנו 26 חיבורים ספרותיים שלמים מאימון (כולל CD, 4QS, Hodayot). הדיוק נשאר יציב על ~30% בכל אורכי הלקונות (32.0% מילה 1, 30.2% 6+ מילים), מה שמוכיח הכללה תחבירית אמיתית מעבר לשינון עדים מקבילים.
  • נירמול מורפולוגי (Morphological Normalization): שימוש בלמות (Lemmas) בעזרת DictaBERT-lex. המדידה מתעלמת מהבדלי כתיב מלא/חסר (כול/כל, כיא/כי, לוא/לא), אותיות סופיות וגרסאות שם השם (יי/יהוה).

אימות היעדר דליפת אורך סאב-טוקנים

מודל MsBERT שנבחר כמקודד הליבה הוא מודל של מילים שלמות (Whole-Word). הראינו שהוא מקודד מילים עבריות מורכבות (כולל קידומות ויחס) כטוקן בודד.

זה מבטיח שהמודל מקבל סיגנל מסיכה בודד לכל מילה חסרה, ללא כל רמז (Leakage) לגבי מספר האותיות או הטוקנים המרכיבים אותה.

חשיפת הטיות מודלים

מלכודת הטוקניזציה וקריסת BEREL

מודלים מבוססי חלקי מילים (Subwords) כמו BEREL קיבלו בעבר תוצאות מעולות. גילינו שהקוד "הדליף" להם את אורך חלקי המילה מראש (כמו לדעת את מספר האותיות באיש תלוי). פיתחנו פענוח דינמי ללא דליפה. ברגע שחסמנו את ההדלפה, ביצועי BEREL קרסו.

מודל / סוג הערכה מילה 1 חסרה 2 מילים 3 מילים 4-5 מילים 6+ מילים
MsBERT ft-SPAN-refined (שלנו - מילים שלמות) 37.3% 34.7% 31.1% 29.4% 31.0%
TavBERT (tau/tavbert-he - ברמת האות) 30.0% 23.0% 23.3% 21.5% 26.3%
BEREL ft-SPAN (סאב-טוקנים - הערכה אופטימית) 36.0% 30.7% 28.4% 25.4% 26.8%
BEREL (סאב-טוקנים - פענוח דינמי ריאליסטי) 26.0% 21.0% 20.7% 14.9% 6.9%

קריסה דרמטית של BEREL בלקונות ארוכות (מ-23.6% ל-6.9%) מוכיחה את נחיצות מודל המילים השלמות (MsBERT) שאינו דורש מידע מוקדם על אורך.

אלגוריתמי פענוח

פענוח סדרתי מונע כפילויות ותחביר שגוי

  • פענוח סדרתי (Left-to-Right Beam Search): במקום לנחש את כל המילים במקביל (שיוצר חזרות מביכות כמו "אשר אשר"), המודל מנחש מילה, נועל אותה, ומנחש את הבאה אחריה.
  • ההישג: הכפלת הדיוק בפענוח רצפים שלמים של 3 מילים, ושלשול הדיוק (פי 3) בלקונות של 4-5 מילים.
  • דיכוי אותיות יחס (Particle Domination): העברית במגילות מפרקת אותיות יחס (ב, ל, ו) כמילים עצמאיות. מודל ה-Span המכוונן נטה להציע רק אותן. פתרנו זאת באמצעות refined span-ft המנטרל אותיות אלו כמטרות מסיכה באימון.

פענוח מועצם (Enhanced Decoding Top-10)

שילוב נירמול למות בדירוג, אילוץ אורך פיזי וחלון הקשר 40 מילים:

מנגנון פענוח 1 מילה 2 מילים 3 מילים 4-5 מילים 6+ מילים
סטנדרטי (Beam Search) 32.0% 34.0% 34.0% 28.4% 35.7%
מועצם (Enhanced) 36.0% 36.0% 36.7% 32.0% 39.8%

האופטימיזציה המאוחדת מעלה את דיוק השחזור ב-2.0% עד 4.1% בכל דלי, ומביאה לקונות ארוכות מאוד ל-39.8% דיוק.

סימנים מהעולם האמיתי

אילוץ פיזי וחיפוש מקבילות (RAG)

  • אילוץ רוחב פיזי (Physical Constraint): מסננים מועמדים שקצרים מהרווח הפיזי המשוער (למשל `len(w) >= len(gold) - 1`). תוצאה: שיפור של 19% בדיוק ניחוש מילות תוכן (שמות עצם ופעלים).
  • Parallel Witness (RAG) - עוצמת העד המקביל: שליפת ביטויים זהים מקורפוס קומראן (ללא המגילה הנבדקת). כאשר מזוהה ביטוי מקביל בקורפוס, הדיוק מזנק מ-~12% ל: 77.2% Top-1 בחיפוש Cross-Composition (החרגת כל עותקי אותו חיבור, למשל החרגת 1QS בבדיקת 4Q258). 81.1% Top-1 בחיפוש בערבוב כלל המגילות הלא-מקראיות.

שחזור לקונה באורך לא-ידוע (300 לקונות)

בהערכה על 300 פערים באורך לא-ידוע, שילוב RAG מעלה את דיוק הרצף הכללי מ-6.0% ל-8.3% Top-1 (+38.9% שיפור יחסי):

מנגנון 1 מילה 2 מילים 3 מילים משוקלל
ללא RAG (MsBERT Top-1) 12.0% 3.0% 3.0% 6.0%
עם RAG (Top-1) 14.0% 7.0% (+133%) 4.0% 8.3% (+38.9%)
RAG + פענוח מועצם (Top-10) 48.0% 35.0% 34.3% 36.8%

שילוב RAG עם אילוץ אורך פיזי ואיחוד למות מעלה את דיוק ה-Top-10 למילה בודדת ל-48.0% ול-36.8% בממוצע כללי.

תוצאות איכותיות

מקרי בוחן אמיתיים ממגילת סרך היחד (1QS)

אלמנט אינטראקטיבי

מודל מוסבר: מפות קשב (Attention Saliency)

כדי שהכלי לא יהיה "קופסה שחורה", אנו מציגים לחוקר באילו מילים המודל השתמש. ניתוח של 9,000+ מילים מראה ש-32% ממשקל הקשב מרוכז ב-3 המילים הסמוכות ללקונה, ושמילות תוכן מקבלות פי 2 קשב מאותיות חיבור.

הדגמה אינטראקטיבית (העבירו את העכבר מעל המילים לקבלת רמת הקשב):

לעשות אמת ו [ צדקה ] ו משפט ב ארץ
קשב גבוה (>0.20)
קשב בינוני (0.08 - 0.20)
קשב נמוך (<0.08)
נטרול הטיית השינון

קבוצת הביקורת המקראית (Biblical Contrast Set)

  • התנ"ך כמקור שינון: מכיוון שמודלי שפה עבריים מאומנים על מיליוני מילים הכוללים את התנ"ך, הם לומדים אותו בעל פה ומציגים רמת דיוק מלאכותית ומופרזת.
  • הוכחת ה-Domain Shift: במגילות מקראיות, מודל הבסיס (MsBERT base) השיג תוצאות טובות יותר מאשר המודל המכוונן שלנו (57.5% מול 52.5% Top-10 למילה בודדת). הפיינטיונינג התאים את המודל ללשון הכיתתית של קומראן על חשבון המקרא הסטנדרטי, מה שמוכיח את נחיצות ההפרדה במאמר.

ביצועים במגילות מקראיות (MsBERT base)

רמת דיוק Slot-Level Top-10 לקבוצת הביקורת:

אורך הלקונה דיוק מקראי
מילה 1 חסרה 57.5%
2 מילים חסרות 48.8%
3 מילים חסרות 37.5%
4-5 מילים חסרות 36.2%

ביצועים אלו משמשים כרף היכולת העליון (Performance Ceiling) של המודלים בעברית קלאסית.

מבט ריאליסטי על הביצועים

ניתוח שגיאות ומגבלות מובנות

  • אימון נקי משחזורי חוקרים: המודל אומן על טקסט לא־מקראי שמור בלבד. כל טקסט בתוך סוגריים מרובעים הוחלף ב־<GAP>, והחלוקה בין אימון למבחן נעשתה ברמת המגילה.
  • השוואה אמיתית לקריאות חוקרים: מתוך 346 אתרים שנאספו מ־Qumran Digital, הסינון הסמנטי השאיר 74 לקונות חד־מילתיות ו־99 קריאות ייחודיות. וריאנטים כתיביים, תיקוני סופר, קריאות רב־מילתיות וקריאות שסותרות אותיות שמורות דווחו כהחרגות.
  • יחידת המדידה: כל אתר כתב־יד נספר פעם אחת. הצלחה פירושה שלפחות קריאה מיוחסת אחת, התואמת לאותיות השמורות ולאומדן אורך הלקונה, נמצאת ב־Top-K.

מה השתנה בניסוי המתוקן?

ללא אילוצים פיזיים: 9.5% Top-10 על אותם 74 אתרים.

עם אותיות שמורות ואורך ±1: 63.5% Top-10 ברמת האתר, עם רווח סמך של 51.4%–74.3%.

בדיקת רגישות: 69.5% באורך מדויק, 63.5% ב־±1 ו־62.7% ב־±2.

חשוב: זהו שיפור במפענח המלא בזכות מידע פיזי, לא קפיצה של 54 נקודות במודל השפה עצמו.

מיקום המחקר בספרות העולמית

ספרות מקצועית ומחקרים קרובים בעולם

Ithaca / Aeneas (Nature 2022 / 2025)

Google DeepMind & Oxford

שחזור כתובות ביוונית ולטינית בעזרת Transformers, הצעת רשימות Top-K, מפות קשב וחיפוש מקבילות (RAG) לאורכים לא ידועים.

✦ התאמנו לעברית של בית שני, מילים שלמות, וסינון RAG קשיח למניעת דליפה.

MsBERT (ACL 2024)

Dicta & Bar-Ilan University (Shmidman et al.)

מודל מילים שלמות (Whole-word MLM) לשחזור לקונות בכתבי יד עבריים מתקופת ימי הביניים (טקסטים רבניים וליטורגיים).

✦ מודל הבסיס שלנו! ביצענו פיינטיונינג ללשון קומראן, refined span-ft ואילוצי layout.

Akkadian MLM (EMNLP 2021 / PNAS 2020)

Bar-Ilan & Tel Aviv (Lazar et al. / Fetaya et al.)

שחזור לוחות יתדות באכדית/בבלית בעזרת מודלי שפה ופענוח דינמי מבוסס תוויות המשך (##).

✦ אימצנו את הפענוח הדינמי שלהם להוכחת קריסת BEREL בשל דליפת subtoken.

Embible (EACL 2024)

Andrew Fono et al.

שחזור לקונות בטקסטים מקראיים בעברית וארמית.

✦ אנחנו התמקדנו במגילות כיתתיות לא-מקראיות בלבד כדי למנוע הטיית שינון התנ"ך.

TavBERT (2022)

Omri Keren et al. (Tel Aviv University)

מודל מבוסס תווים (Character-level BERT) בעברית המיועד לניקוד, ניתוח מורפולוגי וזיהוי ישויות.

✦ בחנו אותו על לקונות קומראן (Top-10: 30.0% למילה 1, 26.3% ל-6+ מילים). MsBERT גובר עליו בזכות ייצוג מילים שלמות.

הכללה בין-תקופתית (Cross-Epoch)

ניסוי הכללה לכתבי יד היסטוריים

בחינת המודל המכוונן שלנו (MsBERT ft-SPAN) על קורפוס טקסטים עבריים היסטוריים חיצוניים (קהיר/רבניים).

✦ תוצאה: 39.0% Top-10 Slot Accuracy, המוכיחה יכולת הכללה תחבירית חוצה תקופות מעבר לקומראן.
אינטגרציה עם תשתיות המחקר באקדמיה

אקוסיסטם הנתונים של מגילות קומראן

Scripta Qumranica Electronica (SQE)

פרופ' אשבל רצון, אוניברסיטת גטינגן ורשות העתיקות

פלטפורמת מחקר דיגיטלית (TEI-XML/JSON) המשלבת קואורדינטות פיקסל של קטעי המגילות, יישור טקסטולוגי והצעות שחזור מהדירים.

גשר לשיתוף פעולה: חיבור מודל ה-AI שלנו למבני הנתונים של SQE לצורך הצגת מועמדי שחזור ישירות בסביבת העבודה של SQE.

ספריית המגילות ע"ש ליאון לוי (רשות העתיקות)

The Leon Levy Digital Library (IAA)

ארכיון צילומים מולטי-ספקטראליים (Infrared) ברזולוציה גבוהה של כל 25,000+ קטעי המגילות, ממופה לפי לוחות ומספרי קטע.

אילוצים פיזיים: חילוץ אורך השורה הפיזי (במילימטרים/פיקסלים) ישירות מתמונות ה-IR לסינון מועמדים.

Qumran Digital: Text und Lexikon

מאגר קריאות מיוחסות ביבליוגרפית

צילום מצב שמור מ־21 במאי 2026 כולל 1,811 קריאות מפורשות ב־346 אתרים ו־253 מקורות ביבליוגרפיים. המאגר משמש להערכה בלבד ולעולם אינו נכנס לאימון.

השוואה ניתנת לשחזור: הניתוח רץ מקומית מן העותק השמור, ללא סריקה חוזרת של הרשת, ומפריד בין קריאות קימרון, Study Edition, DJD ומקורות נוספים.
סיכום ומבט קדימה

הצעדים הבאים לקראת מאמר

  • קוד ומצגת זמינים לחוקרים: מצגת ודמו חי ב-https://dss-restoration-demo.pages.dev/slides_he.html ובקוד פתוח ב-GitHub.
  • מניעת כפל מאמצים באקדמיה: שיח פתוח ושיתוף פעולה עם פרופ' אשבל רצון (SQE) וקבוצת אוניברסיטת בן-גוריון (QTD).
  • ממצאי האמפיריקה המרכזיים: אימון ללא שחזורי חוקרים, השוואה מיוחסת מול Qumran Digital, שילוב אותיות שמורות ואומדן אורך פיזי, ודירוג מועמדים מוסבר (Saliency).

📊 תוצאות הניסויים המרכזיות (Empirical Highlights)

63.5% Top-10
הסכמה ברמת אתר מול חוקרים (N=74)
60.6% Top-10
99 זוגות ייחודיים של אתר–קריאה
36.3% Top-10
בקרת מילים שמורות, מודל ללא שחזורים
51.4%–74.3%
רווח סמך 95% ל־Top-10

התוצאה 63.5% מודדת מפענח עם אילוצים פיזיים; ללא האילוצים, אותם אתרים משיגים 9.5% Top-10.

1 / 14
ניווט באמצעות מקשי החצים ו- במקלדת