stage: measurement
type: baseline
product: prism-site
run_id: baseline-2026-07-21
date: 2026-07-21
owner: נועה (content_writer)
target: https://prism-site-preview.pages.dev
method: curl · בדיקת HTTP חיה מול האתר החי. כל שורה כאן נמדדה, לא הונחה.
spec_ref: specs/v2-article-engine.md §12
**כל עוד אנחנו על *.pages.dev — אנחנו לא בונים נכס אורגני.**
בן דחה את חיבור הדומיין (21.7, "נחכה עם זה… שלב מאוד מאוחר"). זו החלטה סבירה,
ויש לה מחיר שצריך להיות כתוב:
| מה שנכון לומר | מה אסור לומר |
|---|---|
| "מדדנו את כשירות הסריקה ותיקנּו אותה" | ~~"אנחנו בונים נכס אורגני"~~ |
| "יש קו בסיס נקי לפני שהוספנו תוכן" | ~~"התחלנו לצבור נראות"~~ |
| "האתר עכשיו ניתן לסריקה" | ~~"האתר מדורג / מצוטט"~~ |
למה זו לא קפדנות סרק: דומיין זמני על תת־דומיין משותף הוא לא בסיס לסמכות
אורגנית. תוכן שיפורסם עכשיו לא בונה היסטוריה שתעבור בשלמותה לדומיין עתידי.
הציפייה לציטוט ב־AI יורדת בהתאם, וזה נרשם כאן ולא ייבלע.
ובכל זאת המדידה לא מיותרת: קו הבסיס הנקי קיים פעם אחת, והוא נלכד.
התיקונים של §3ד היו נחוצים בכל מקרה — אתר עם soft-404 גורף לא היה נסרק
גם בדומיין הכי טוב בעולם. תיקנו את מה שתלוי בנו.
באוויר שתי כתבות בלבד. זה חלון חד־פעמי: קו בסיס כמעט נקי.
ברגע שנפרסם עוד — הוא אבד ולא ישוחזר.
זו הסיבה שההרצה הזו קדמה ל־Vision ול־Logo.
תכננתי למדוד ציטוטים ומצאתי בעיה שקודמת לזה.
אין טעם לשאול "האם ChatGPT מצטט אותנו" לפני שהאתר בכלל ניתן לסריקה תקינה.
בדקתי, וזה מה שיצא:
200 עם דף הבית
curl -s -o /dev/null -w '%{http_code}' .../definitely-not-a-real-file-xyz123.txt
→ 200 (ומחזיר את ה־HTML של דף הבית)
זו התקלה הכי חמורה שמצאתי. משמעותה:
404. מנוע סריקה לא יכול לדעת מה לא קייםהסיבה: אין 404.html ב־dist/. אימתתי — הקובץ לא קיים.
בבדיקה ראשונה robots.txt, llms.txt ו־sitemap.xml החזירו 200.
כמעט רשמתי אותם כקיימים. הם לא — זה היה 1א שמטעה.
| קובץ | סטטוס אמיתי |
|---|---|
robots.txt | 🔴 לא קיים |
sitemap.xml | 🔴 לא קיים |
llms.txt | 🔴 לא קיים (§4ג במפרט הבטיח שנוסיף) |
📌 הלקח, והוא שווה יותר מהממצא: 200 הוא לא הוכחת קיום.
אימות דורש בדיקה מול כתובת שאמורה להיכשל.
הכנסתי את זה כשער קבוע ב־§3ג למטה.
לא הכל שבור. שתי הכתבות בנויות היטב:
| בדיקה | מצב |
|---|---|
canonical לכל עמוד | ✅ נכון וייחודי |
hreflang — en · he · x-default | ✅ הדדי ומלא |
<html lang="he" dir="rtl"> | ✅ נכון בעברית |
JSON-LD BlogPosting | ✅ headline · author · datePublished · dateModified · inLanguage |
| כותרות ותיאורים | ✅ ייחודיים לכל עמוד ולכל שפה |
noindex בדומיין הראשי | ✅ אין. (רק תת־הדומיין preview. נושא אותו) |
המבנה הדו־לשוני עובד. זה בדיוק מה ש־GEO דורש, וזה כבר קיים.
homepage application/ld+json count → 0
לדף הבית אין Organization schema. הכתבות מוגדרות, הישות עצמה לא.
| מדד | ערך ב־21.7.2026 |
|---|---|
| עמודים אמיתיים באתר | 8 (בית · 2 אינדקסים · 2 כתבות × 2 שפות) |
| כתבות | 2 (×2 שפות) |
| שיעור ציטוט ב־AI | טרם נמדד — ראה §3 |
robots.txt · sitemap.xml · llms.txt | 0 מתוך 3 |
| כתובות שגויות שמחזירות 200 | הכל |
| דומיין | *.pages.dev — לא דומיין משלנו |
מדד הציטוט נשאר ריק בכוונה. לא אמלא אותו בניחוש.
הסיבה למה עוד לא נמדד — §3ב.
measurement/prompt-panel.yaml — 30 שאלות נעולות, 3 סוגים (מותג · נושא · בקרה),
עברית ואנגלית. מוכן להרצה.
אין לי גישה תוכניתית ל־ChatGPT, Perplexity, Gemini או Claude כמנועי חיפוש.
יש לי חיפוש ושליפת דפים — לא שאילתה למנוע תשובות.
לכן:
בן הכניס את רותם למחקר פתרון (21.7; בהמשך רעיון: crawl4ai).
אני לא ממתינה לזה ולא פותרת לבד — כשיהיה מסלול, מריצות יחד
וזה בסדר, כי §1 שינה את הסדר בלאו הכי: אין טעם למדוד ציטוט
של אתר שלא ניתן לסריקה תקינה. קודם מתקנים, ואז מודדים.
כל בדיקת נוכחות חייבת לכלול כתובת בקרה שאמורה להיכשל.
אם גם היא מחזירה 200 — הבדיקה פסולה ולא מדווחת.
זה נכנס למפרט כחוק, לא כהמלצה.
לא השארתי את הממצאים כרשימת מטלות. 1–4 היו שלי, ונסגרו.
| תיקון | לפני | אחרי (אומת ב־curl) |
|---|---|---|
404.html | כל כתובת שגויה → 200 + דף הבית | 404 ✅ |
robots.txt | לא קיים | 200 · text/plain ✅ + מפנה ל־sitemap |
sitemap.xml | לא קיים | 200 · application/xml ✅ + hreflang |
llms.txt | לא קיים | 200 · text/plain ✅ |
Organization schema בדף הבית | 0 | ✅ קיים |
בדיקת הבקרה של §3ג עברה: /definitely-not-a-real-file-xyz123.txt → 404.
זו אותה כתובת שחשפה את התקלה, ועכשיו היא נכשלת כמו שצריך.
בלי הבדיקה הזו הייתי "מאמתת" את התיקון מול אותו באג שהסתיר אותו.
שערים: npm run verify ירוק — build ✅ · JS budget 0 bytes ✅ · honesty 8/8 ✅.
נפרס: prism-site-preview production, 21.7.
הערה תפעולית: הדומיין הראשי הגיש cache ישן ~דקה אחרי הפריסה.
אימות מיד אחרי deploy יכול להחזיר תוצאה שגויה — יש להמתין ל־content-type החדש.
מה נשאר פתוח: הרצת הפאנל (עברה לרותם) והדומיין (נדחה) — אף אחת מהן לא חוסמת אותי.
| # | מה | למה | בעלים |
|---|---|---|---|
| 1 | 404.html | בלעדיו כל שאר המדידה חסרת משמעות | ✅ בוצע 21.7 |
| 2 | robots.txt + sitemap.xml | בלעדיהם אין סריקה מסודרת | ✅ בוצע 21.7 |
| 3 | llms.txt | הובטח ב־§4ג. עלות אפס | ✅ בוצע 21.7 |
| 4 | Organization JSON-LD בדף הבית | הישות שלנו לא מוגדרת | ✅ בוצע 21.7 |
| 5 | הרצת הפאנל | חסום — ראה §3ב | 🔄 רותם — בן הכניס אותה 21.7 למחקר פתרון (בהמשך: crawl4ai) |
| 6 | דומיין | *.pages.dev הוא לא בסיס לנכס אורגני | ⏸ נדחה בהחלטת בן 21.7. jungohub.com, זמני. שלב אחרון ב־pipeline. ראה §0א — התקרה שזה מטיל |
1–4 נסגרו באותו יום ואומתו — ראה §3ד.
5 עבר לרותם (בן, 21.7) — אני לא ממתינה לזה ולא פותרת את זה לבד.
הפאנל נשאר לא מורץ ומסומן ככזה. כשרותם תחזור עם מסלול — מריצות יחד.
6 נדחה בהחלטת בן — לא ממתינה ולא מבקשת טוקן. התקרה שזה מטיל רשומה ב־§0א.
החסם הוסר. 1–4 נסגרו באותו יום, והאתר עכשיו כשיר לסריקה:
404 אמיתי, sitemap.xml, robots.txt שמזמין את זחלני ה־AI, ו־llms.txt.
כלומר: הכתבה הבאה תיכתב לאתר שיכול להיסרק — מה שלא היה נכון הבוקר.
זה בדיוק מה שקו בסיס אמור לגלות, וזו הסיבה שהוא קדם ל־Vision ול־Logo.
הממצא של §1ב — "200 הוא לא הוכחת קיום, וכמעט דיווחתי שלושה קבצים כקיימים" —
הוא בדיוק התוכן שהקול "יומן בנייה" נבנה בשבילו.
מ־research/v2-competitors.md: 9 מתחרים מבטיחים ציטוט, אף אחד לא מראה מדידה אמיתית.
נושא לתור: "בדקנו אם האתר שלנו כשיר ל־AI. הוא לא היה. הנה מה שמצאנו."
evidence_ref: measurement/baseline-2026-07-21.md — ראיה שקיימת, לא רעיון.