{"as_of":"2026-08-18T00:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:543ed147057644fa92ec2fb40d3671e63511e3ae7db2f8072c8a3dd5d0fc7481","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:00:32.747694Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:36:55.345947Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:36:55.445243Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"cited_work":{"arxiv_id":"2501.11721","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11721","snapshot_observed_at":"2026-08-15T20:36:55.445243Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","venue":"cs.CL","work_id":"2fc8f455-704a-47bd-b9b0-0b5cb01c776b","year":2025},"citing_paper":{"arxiv_id":"2505.20305","last_updated":"2025-05-18T17:30:10Z","snapshot_observed_at":"2026-08-15T20:30:10.564235Z","submitted_at":"2025-05-18T17:30:10Z","title":"Making Sense of the Unsensible: Reflection, Survey, and Challenges for XAI in Large Language Models Toward Human-Centered AI","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:36:55.345947Z"},"links":{"cited_paper":"/paper/2501.11721","citing_paper":"/paper/2505.20305"},"observation_digest":"sha256:10a15b02ee03099796ff538cbd6dfe3c59fb2f7949eb61751746c3aeb4e29051","observation_id":"4a41e5e2-253d-4009-bdaa-2fe060155d38","resolution":{"observed_at":"2026-08-15T20:36:55.451186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.11721/citation-record","integrity":"/paper/2501.11721/integrity","json":"/paper/2501.11721/citation-record.json","paper":"/paper/2501.11721"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.124936Z","title":"Introducing gemini: Google's multimodal ai model","venue":null,"work_id":"8d47f85c-d734-45e4-8488-145b86486e07","year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.642092Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:7b7a01ef1dc9709f578c1aa6798de4c49951989f85c26a11cc90bd56dc7cea98","observation_id":"9af8672c-e08a-41b2-91b7-49dbd3c8b608","resolution":{"observed_at":"2026-08-10T18:00:33.129677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.110273Z","title":"Introducing claude: Anthropic's ai assistant","venue":null,"work_id":"ce1c82ed-e29c-4812-a0b7-53b46885c4bf","year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.647171Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:8775e01510480109781b2b8ccc59ab09fc55f7dd48735f7f911a22d1aabd2ae1","observation_id":"604d3217-b67a-4864-83c9-53b324ee341a","resolution":{"observed_at":"2026-08-10T18:00:33.114815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.095058Z","title":"Explainability in ai: A survey","venue":null,"work_id":"580d3dac-f122-456a-bd16-e99e4dab633b","year":2022},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.651632Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:f562e97e56c76868ff62faeaf2de1d8c182712ef7e487c4309009adba87a7a3f","observation_id":"6c624207-06d6-40f1-b487-e8e488aa30e5","resolution":{"observed_at":"2026-08-10T18:00:33.100711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.080833Z","title":"On the dangers of stochastic parrots: Can language models be too big? In Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency, pp.\\ 610--623, 2021","venue":null,"work_id":"bf4db76d-e073-4ca1-b7f1-7979b40ade7e","year":2021},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.656481Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:0d21a16a923d8b1a94d3279bcb115acb03c3cb557c5f3069c27ebe1fef821697","observation_id":"4745ce75-e64c-4df0-bb58-1a58cf4b7fb3","resolution":{"observed_at":"2026-08-10T18:00:33.085857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-10T18:00:32.660995Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.660995Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:afd4dd48e4870d5f7d82537233229f4a439e86b55fa2e4b190a596cff7f9c680","observation_id":"38fa1fa5-51b2-4ff2-9a2c-49782fe47314","resolution":{"observed_at":"2026-08-10T18:00:32.660995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.066985Z","title":"Language models are few-shot learners","venue":null,"work_id":"53b35d91-b5f7-4483-adc7-48e00dc35317","year":1901},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.665972Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:3d0065decac24dff0e9f4a16cc9f97435a4111943dd2a2e1f6df7d01c7f4d10e","observation_id":"3f885034-6a26-45aa-a436-1f61cc575181","resolution":{"observed_at":"2026-08-10T18:00:33.071485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.052841Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"19a6b064-85f3-40f2-9b00-8edcab657812","year":2019},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.671018Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:a16d0340b74cb08830e78a762a1b12f7430565281ba6d7ae73d4c5ce600c0762","observation_id":"e7c0ecb4-fe86-414c-949e-8c707a9f56c5","resolution":{"observed_at":"2026-08-10T18:00:33.057548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05678","last_updated":"2023-05-23T19:06:09Z","snapshot_observed_at":"2026-08-16T22:09:10.798107Z","submitted_at":"2023-05-09T18:00:00Z","title":"What if $\\phi^4$ theory in 4 dimensions is non-trivial in the continuum?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05678","snapshot_observed_at":"2026-08-10T18:00:32.675479Z","title":"Evaluating para-consistency in large language models: A novel benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.675479Z"},"links":{"cited_paper":"/paper/2305.05678","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:644fe0da536a989242fecbe47cae6769ae9fff1afb5e64cf99236f789ba2406e","observation_id":"05283e8a-614a-4685-a41b-4bad9c1d6467","resolution":{"observed_at":"2026-08-10T18:00:32.675479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01234","last_updated":"2023-04-03T06:54:22Z","snapshot_observed_at":"2026-08-16T15:43:19.473707Z","submitted_at":"2023-04-03T06:54:22Z","title":"Prediction of solar wind speed by applying convolutional neural network to potential field source surface (PFSS) magnetograms","version":1},"cited_work":{"arxiv_id":"2304.01234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.01234","snapshot_observed_at":"2026-08-10T18:00:32.928195Z","title":"Prediction of solar wind speed by applying convolutional neural network to potential field source surface (PFSS) magnetograms","venue":"astro-ph.SR","work_id":"5c7392d4-d3ab-4492-aca9-4aff46a3ae87","year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.680162Z"},"links":{"cited_paper":"/paper/2304.01234","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:116b493e52339a0ba39eda45619135534c22884f844c6d67f154b5a6a01514e4","observation_id":"c537fa1b-b37e-464c-9e4f-0d61bb4d2692","resolution":{"observed_at":"2026-08-10T18:00:32.933485Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04500","last_updated":"2024-07-08T13:38:54Z","snapshot_observed_at":"2026-08-16T15:25:47.907466Z","submitted_at":"2023-06-07T15:09:37Z","title":"Structure Factors for Hot Neutron Matter from Ab Initio Lattice Simulations with High-Fidelity Chiral Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04500","snapshot_observed_at":"2026-08-10T18:00:32.684957Z","title":"Self-critique training: Improving large language models through iterative feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.684957Z"},"links":{"cited_paper":"/paper/2306.04500","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:b279a7044baa543ba5ec53687e9d23bbf4faa525afbfd3ccac40457d818decfd","observation_id":"a725d6df-df7f-4458-add2-f214bc0435c1","resolution":{"observed_at":"2026-08-10T18:00:32.684957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15420","last_updated":"2024-11-01T14:56:52Z","snapshot_observed_at":"2026-08-16T13:58:25.400648Z","submitted_at":"2024-04-23T18:10:42Z","title":"XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference","version":3},"cited_work":{"arxiv_id":"2404.15420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.15420","snapshot_observed_at":"2026-08-10T18:00:32.888726Z","title":"XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference","venue":"cs.CL","work_id":"033660cc-2865-4d03-8326-1eac53834edb","year":2024},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.689053Z"},"links":{"cited_paper":"/paper/2404.15420","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:9dd5692789db7776063839942f8616198e11831777bc0fcaebaed8a2eb4a1f23","observation_id":"d4f9bfda-7183-431a-8d62-7ff38e768035","resolution":{"observed_at":"2026-08-10T18:00:32.894951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11811","last_updated":"2024-11-05T16:47:43Z","snapshot_observed_at":"2026-08-16T13:42:08.164911Z","submitted_at":"2024-06-17T17:52:54Z","title":"RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11811","snapshot_observed_at":"2026-08-10T18:00:32.693612Z","title":"Repliqa: A question-answering dataset for benchmarking llms on unseen reference content","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.693612Z"},"links":{"cited_paper":"/paper/2406.11811","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:006101ac74b38d37a682e18beb0757509bf00283bef575bb6a7429c9c2de480e","observation_id":"e7c513f4-769a-460a-86d0-0771b8c722e9","resolution":{"observed_at":"2026-08-10T18:00:32.693612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:32.697624Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.697624Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:a198cb965118fac12560be0eecffa7aae2296ae2779b90612bafb58dbe6a1d19","observation_id":"b06cca36-3cec-43ab-ba6d-052c9c216d86","resolution":{"observed_at":"2026-08-10T18:00:32.697624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.029906Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":"52ea6eaf-d522-416e-87ca-24f2ab47d1f2","year":2016},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.701626Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:7f6bea147d8d9849bd98b4113c9fadad8cb4ff908eb5d2769503be8e6d8f67c9","observation_id":"29a10000-aa0b-4db0-ba6b-4d80c3c78123","resolution":{"observed_at":"2026-08-10T18:00:33.034560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16640","last_updated":"2024-10-22T02:38:48Z","snapshot_observed_at":"2026-08-16T13:07:09.337288Z","submitted_at":"2024-10-22T02:38:48Z","title":"A Statistical Analysis of LLMs' Self-Evaluation Using Proverbs","version":1},"cited_work":{"arxiv_id":"2410.16640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16640","snapshot_observed_at":"2026-08-10T18:00:32.845290Z","title":"A Statistical Analysis of LLMs' Self-Evaluation Using Proverbs","venue":"cs.CL","work_id":"24b0cad0-7d91-4d19-ab02-c5fd0742338e","year":2024},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.705662Z"},"links":{"cited_paper":"/paper/2410.16640","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:f59a9bf9f336b24d699035b56bfe1bdf599b2de3419457af12f7f7e48fba35d4","observation_id":"94671660-d958-470d-8465-82b5acbbfaf9","resolution":{"observed_at":"2026-08-10T18:00:32.852516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T18:00:32.709790Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.709790Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:e27b553549b5191d8ce1413d9890221fa739a66497479db956dfaed9f5554a5b","observation_id":"152ce31f-476b-490f-b0de-7a40c0496714","resolution":{"observed_at":"2026-08-10T18:00:32.709790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06789","last_updated":"2023-05-24T01:20:16Z","snapshot_observed_at":"2026-08-16T15:55:33.583755Z","submitted_at":"2023-02-14T02:18:23Z","title":"On the fluid slip along a solid surface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06789","snapshot_observed_at":"2026-08-10T18:00:32.714286Z","title":"Robustness of language models to syntactic variations: An empirical study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.714286Z"},"links":{"cited_paper":"/paper/2302.06789","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:4b9426576320f7c907586b42231c80ec85af41a750f31b570264488da1935e4d","observation_id":"8cfcdcf8-cdd4-4a73-9b45-91dcf06e0348","resolution":{"observed_at":"2026-08-10T18:00:32.714286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-10T18:00:32.718756Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.718756Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:5182913a62fd7cdf2171277f8631ae80b58a03b5e389ce80c102f9c4ac70b447","observation_id":"3250ac9a-1429-4ea8-a333-a1313e7004d2","resolution":{"observed_at":"2026-08-10T18:00:32.718756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.015889Z","title":"Teach me to explain: A review of machine learning interpretability through explanations","venue":null,"work_id":"6cb72a1b-f9d0-4bd1-8bee-ac1242c46d17","year":2021},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.723277Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:813f0e3e8747056c300d004909e872daae8d5328b3765f108ea36aa47906fd90","observation_id":"14b953e3-a8be-47dc-998b-8f641d11d0b5","resolution":{"observed_at":"2026-08-10T18:00:33.020554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10516","last_updated":"2024-07-09T02:56:14Z","snapshot_observed_at":"2026-08-16T13:51:59.694086Z","submitted_at":"2024-05-17T03:50:28Z","title":"Language Models can Evaluate Themselves via Probability Discrepancy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10516","snapshot_observed_at":"2026-08-10T18:00:32.727925Z","title":"Language models can evaluate themselves via probability discrepancy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.727925Z"},"links":{"cited_paper":"/paper/2405.10516","citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:1db0d8db51785fd9786a9c3020ffa3779a5c58d1e480000d9e89b7095597705f","observation_id":"9cf92435-8d6a-446c-b62c-9041449ef5c9","resolution":{"observed_at":"2026-08-10T18:00:32.727925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:33.002001Z","title":"Evaluating paraphrase sensitivity in large language models","venue":null,"work_id":"42e327c6-caef-40dd-9449-0a9d7dd35fc5","year":2023},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.732816Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:50c7060cd9533aabd99bf5fa84bbc5655076f995e625000d65b554e98c140d5c","observation_id":"aac56f11-00f1-4206-b11f-996977b5673c","resolution":{"observed_at":"2026-08-10T18:00:33.006280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:32.737661Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.737661Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:d64c0448685f60745813f13cb76acc1d744662c210c037c0d1983d84758eea16","observation_id":"beac91c4-4df4-43ca-92f2-6504e68182b8","resolution":{"observed_at":"2026-08-10T18:00:32.737661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:32.743000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.743000Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:ed8a57cd3a84ac3aec1e0b74607f106b48e15327b93ee0e0daca6d50c11b7a1b","observation_id":"ad4ab37a-ed28-4d22-bcd9-ffb4d37d84f9","resolution":{"observed_at":"2026-08-10T18:00:32.743000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:00:32.747694Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:32.747694Z"},"links":{"citing_paper":"/paper/2501.11721"},"observation_digest":"sha256:b53f3abe5b64e8a188743bb82cbc2797b34b081b3476fb689d5f2bcc1a77b7de","observation_id":"bded3b9a-c992-42de-ad0a-58f71e7b9702","resolution":{"observed_at":"2026-08-10T18:00:32.747694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.11721","last_updated":"2025-03-08T21:56:29Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:28:50.149851Z","submitted_at":"2025-01-20T20:07:18Z","title":"Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2501.11721."}