← חזרה לכל השלבים

stage: measurement
type: baseline
product: prism-site
run_id: baseline-2026-07-21
date: 2026-07-21
owner: נועה (content_writer)
target: https://prism-site-preview.pages.dev
method: curl · בדיקת HTTP חיה מול האתר החי. כל שורה כאן נמדדה, לא הונחה.
spec_ref: specs/v2-article-engine.md §12

קו בסיס — מדידת GEO, הרצה ראשונה

⚠️ 0א. תקרה על מה שהמדידה הזו יכולה להוכיח

**כל עוד אנחנו על *.pages.dev — אנחנו לא בונים נכס אורגני.**

בן דחה את חיבור הדומיין (21.7, "נחכה עם זה… שלב מאוד מאוחר"). זו החלטה סבירה,

ויש לה מחיר שצריך להיות כתוב:

מה שנכון לומר מה אסור לומר
"מדדנו את כשירות הסריקה ותיקנּו אותה"~~"אנחנו בונים נכס אורגני"~~
"יש קו בסיס נקי לפני שהוספנו תוכן"~~"התחלנו לצבור נראות"~~
"האתר עכשיו ניתן לסריקה"~~"האתר מדורג / מצוטט"~~

למה זו לא קפדנות סרק: דומיין זמני על תת־דומיין משותף הוא לא בסיס לסמכות

אורגנית. תוכן שיפורסם עכשיו לא בונה היסטוריה שתעבור בשלמותה לדומיין עתידי.

הציפייה לציטוט ב־AI יורדת בהתאם, וזה נרשם כאן ולא ייבלע.

ובכל זאת המדידה לא מיותרת: קו הבסיס הנקי קיים פעם אחת, והוא נלכד.

התיקונים של §3ד היו נחוצים בכל מקרה — אתר עם soft-404 גורף לא היה נסרק

גם בדומיין הכי טוב בעולם. תיקנו את מה שתלוי בנו.


0. למה עכשיו ולא אחר כך

באוויר שתי כתבות בלבד. זה חלון חד־פעמי: קו בסיס כמעט נקי.

ברגע שנפרסם עוד — הוא אבד ולא ישוחזר.

זו הסיבה שההרצה הזו קדמה ל־Vision ול־Logo.


1. 🔴 הממצא: האתר לא כשיר לציטוט. בכלל.

תכננתי למדוד ציטוטים ומצאתי בעיה שקודמת לזה.

אין טעם לשאול "האם ChatGPT מצטט אותנו" לפני שהאתר בכלל ניתן לסריקה תקינה.

בדקתי, וזה מה שיצא:

1א · כל כתובת שגויה מחזירה 200 עם דף הבית


curl -s -o /dev/null -w '%{http_code}'  .../definitely-not-a-real-file-xyz123.txt
→ 200        (ומחזיר את ה־HTML של דף הבית)

זו התקלה הכי חמורה שמצאתי. משמעותה:

הסיבה: אין 404.html ב־dist/. אימתתי — הקובץ לא קיים.

1ב · שלושה קבצים שחשבתי שקיימים — ולא קיימים

בבדיקה ראשונה robots.txt, llms.txt ו־sitemap.xml החזירו 200.

כמעט רשמתי אותם כקיימים. הם לא — זה היה 1א שמטעה.

קובץ סטטוס אמיתי
robots.txt🔴 לא קיים
sitemap.xml🔴 לא קיים
llms.txt🔴 לא קיים (§4ג במפרט הבטיח שנוסיף)
📌 הלקח, והוא שווה יותר מהממצא: 200 הוא לא הוכחת קיום.
אימות דורש בדיקה מול כתובת שאמורה להיכשל.
הכנסתי את זה כשער קבוע ב־§3ג למטה.

1ג · מה שכן תקין — ומצוין

לא הכל שבור. שתי הכתבות בנויות היטב:

בדיקה מצב
canonical לכל עמוד✅ נכון וייחודי
hreflang — en · he · x-default✅ הדדי ומלא
<html lang="he" dir="rtl">✅ נכון בעברית
JSON-LD BlogPosting✅ headline · author · datePublished · dateModified · inLanguage
כותרות ותיאורים✅ ייחודיים לכל עמוד ולכל שפה
noindex בדומיין הראשיאין. (רק תת־הדומיין preview. נושא אותו)

המבנה הדו־לשוני עובד. זה בדיוק מה ש־GEO דורש, וזה כבר קיים.

1ד · דף הבית — חסר JSON-LD


homepage application/ld+json count → 0

לדף הבית אין Organization schema. הכתבות מוגדרות, הישות עצמה לא.


2. קו הבסיס המספרי

מדד ערך ב־21.7.2026
עמודים אמיתיים באתר8 (בית · 2 אינדקסים · 2 כתבות × 2 שפות)
כתבות2 (×2 שפות)
שיעור ציטוט ב־AIטרם נמדד — ראה §3
robots.txt · sitemap.xml · llms.txt0 מתוך 3
כתובות שגויות שמחזירות 200הכל
דומיין*.pages.devלא דומיין משלנו

מדד הציטוט נשאר ריק בכוונה. לא אמלא אותו בניחוש.

הסיבה למה עוד לא נמדד — §3ב.


3. מדידת הציטוט עצמה

3א · הפאנל נבנה

measurement/prompt-panel.yaml — 30 שאלות נעולות, 3 סוגים (מותג · נושא · בקרה),

עברית ואנגלית. מוכן להרצה.

3ב · ⚠️ ומה שאני לא יכולה לעשות, ואומרת את זה במפורש

אין לי גישה תוכניתית ל־ChatGPT, Perplexity, Gemini או Claude כמנועי חיפוש.

יש לי חיפוש ושליפת דפים — לא שאילתה למנוע תשובות.

לכן:

בן הכניס את רותם למחקר פתרון (21.7; בהמשך רעיון: crawl4ai).

אני לא ממתינה לזה ולא פותרת לבד — כשיהיה מסלול, מריצות יחד

וזה בסדר, כי §1 שינה את הסדר בלאו הכי: אין טעם למדוד ציטוט

של אתר שלא ניתן לסריקה תקינה. קודם מתקנים, ואז מודדים.

3ג · שער אימות חדש — נגזר מ־1ב

כל בדיקת נוכחות חייבת לכלול כתובת בקרה שאמורה להיכשל.

אם גם היא מחזירה 200 — הבדיקה פסולה ולא מדווחת.

זה נכנס למפרט כחוק, לא כהמלצה.


3ד · ✅ תוקן באותו יום — ואומת

לא השארתי את הממצאים כרשימת מטלות. 1–4 היו שלי, ונסגרו.

תיקון לפני אחרי (אומת ב־curl)
404.htmlכל כתובת שגויה → 200 + דף הבית404
robots.txtלא קיים200 · text/plain ✅ + מפנה ל־sitemap
sitemap.xmlלא קיים200 · application/xml ✅ + hreflang
llms.txtלא קיים200 · text/plain
Organization schema בדף הבית0✅ קיים

בדיקת הבקרה של §3ג עברה: /definitely-not-a-real-file-xyz123.txt404.

זו אותה כתובת שחשפה את התקלה, ועכשיו היא נכשלת כמו שצריך.

בלי הבדיקה הזו הייתי "מאמתת" את התיקון מול אותו באג שהסתיר אותו.

שערים: npm run verify ירוק — build ✅ · JS budget 0 bytes ✅ · honesty 8/8 ✅.

נפרס: prism-site-preview production, 21.7.

הערה תפעולית: הדומיין הראשי הגיש cache ישן ~דקה אחרי הפריסה.

אימות מיד אחרי deploy יכול להחזיר תוצאה שגויה — יש להמתין ל־content-type החדש.

מה נשאר פתוח: הרצת הפאנל (עברה לרותם) והדומיין (נדחה) — אף אחת מהן לא חוסמת אותי.


4. מה צריך לקרות — לפי סדר

# מה למה בעלים
1404.htmlבלעדיו כל שאר המדידה חסרת משמעותבוצע 21.7
2robots.txt + sitemap.xmlבלעדיהם אין סריקה מסודרתבוצע 21.7
3llms.txtהובטח ב־§4ג. עלות אפסבוצע 21.7
4Organization JSON-LD בדף הביתהישות שלנו לא מוגדרתבוצע 21.7
5הרצת הפאנלחסום — ראה §3ב🔄 רותם — בן הכניס אותה 21.7 למחקר פתרון (בהמשך: crawl4ai)
6דומיין*.pages.dev הוא לא בסיס לנכס אורגנינדחה בהחלטת בן 21.7. jungohub.com, זמני. שלב אחרון ב־pipeline. ראה §0א — התקרה שזה מטיל

1–4 נסגרו באותו יום ואומתו — ראה §3ד.

5 עבר לרותם (בן, 21.7) — אני לא ממתינה לזה ולא פותרת את זה לבד.

הפאנל נשאר לא מורץ ומסומן ככזה. כשרותם תחזור עם מסלול — מריצות יחד.

6 נדחה בהחלטת בן — לא ממתינה ולא מבקשת טוקן. התקרה שזה מטיל רשומה ב־§0א.


5. מה זה אומר על הכתבה הבאה

החסם הוסר. 1–4 נסגרו באותו יום, והאתר עכשיו כשיר לסריקה:

404 אמיתי, sitemap.xml, robots.txt שמזמין את זחלני ה־AI, ו־llms.txt.

כלומר: הכתבה הבאה תיכתב לאתר שיכול להיסרק — מה שלא היה נכון הבוקר.

זה בדיוק מה שקו בסיס אמור לגלות, וזו הסיבה שהוא קדם ל־Vision ול־Logo.


6. וזו כבר הכתבה הראשונה של המנוע

הממצא של §1ב — "200 הוא לא הוכחת קיום, וכמעט דיווחתי שלושה קבצים כקיימים"

הוא בדיוק התוכן שהקול "יומן בנייה" נבנה בשבילו.

מ־research/v2-competitors.md: 9 מתחרים מבטיחים ציטוט, אף אחד לא מראה מדידה אמיתית.

נושא לתור: "בדקנו אם האתר שלנו כשיר ל־AI. הוא לא היה. הנה מה שמצאנו."

evidence_ref: measurement/baseline-2026-07-21.md — ראיה שקיימת, לא רעיון.