{"as_of":"2026-08-02T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69b20ea56c248f20ebbe4f1c5635cdc7663e0bd5d99b3a4e34b9a6d8dd702229","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:37:41.353329Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:35:47.679312Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19809","snapshot_observed_at":"2026-07-31T23:35:47.679312Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23927","last_updated":"2026-07-27T01:47:12Z","snapshot_observed_at":"2026-08-02T17:00:39.993016Z","submitted_at":"2026-07-27T01:47:12Z","title":"Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T23:35:47.679312Z"},"links":{"cited_paper":"/paper/2604.19809","citing_paper":"/paper/2607.23927"},"observation_digest":"sha256:68e63b2e3b480e4e959080104eab95c162c6b2d7596c89f62551e18d60db948a","observation_id":"182ee173-6991-4f5f-8031-52d41ecddc7c","resolution":{"observed_at":"2026-07-31T23:35:47.679312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19809/citation-record","integrity":"/paper/2604.19809/integrity","json":"/paper/2604.19809/citation-record.json","paper":"/paper/2604.19809"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":"2306.13063","doi":"10.48550/arxiv.2306.13063","metadata_source":"pith","pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-07-11T03:07:50.413356Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","venue":"cs.CL","work_id":"7c5c5f6d-fd68-4f65-ac05-5d90308e8bc2","year":2023},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:21dde896ba4b68c72b7e96925ab39f255656273fc76b1e33a4f1ef8df6578cf4","observation_id":"3b9cade3-da4a-4a5f-8a95-e1f6a1c904bc","resolution":{"observed_at":"2026-05-13T08:40:32.974213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:07.82596+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:07.82596+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07905","last_updated":"2026-05-29T04:53:10Z","snapshot_observed_at":"2026-07-06T22:45:00.816348Z","submitted_at":"2026-02-08T10:54:04Z","title":"MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation","version":2},"cited_work":{"arxiv_id":"2602.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.07905","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"After answering, place a bet on your answer: 1–10 points. If correct, you gain the points. If wrong, you lose them","venue":null,"work_id":"a43a3181-c020-49c9-a463-dc50031e2c8d","year":2007},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"cited_paper":"/paper/2602.07905","citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:59669a782fd69720c452663b46831e33bfc0841bdd70786fe500862d0e3ddaab","observation_id":"3423b013-5f83-4a29-b54c-1058854f55ac","resolution":{"observed_at":"2026-06-01T02:02:27.350423Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Each question has a unique identifier, domain label, subcategory label (5 per domain, 40 total), difficulty rating, question text, 4 answer choices, and a verified correct answer","venue":null,"work_id":"f8795785-d6a2-499b-b386-9a2a365a25c7","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:f387738afd13ac4481e0290f9e1ae1720e2c1e234a22ad048ed8981a6fba14b5","observation_id":"d6892b09-76c7-454f-bcdc-e748c4d6b1cc","resolution":{"observed_at":"2026-05-18T23:22:53.383028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"fixed” — “tailored","venue":null,"work_id":"e79cec77-bf44-4fa3-8db1-2c2400b3bd46","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:edd73be0c6fd987bf28d336a7dc324e7a693df3cb633b5b10f447249eaf578bf","observation_id":"eb81bfdf-64d1-4d6f-9aa9-4204e6de1821","resolution":{"observed_at":"2026-05-18T23:22:53.388045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"strong”—“weak","venue":null,"work_id":"c5524471-2628-4db0-a5d2-638205819d62","year":2026},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:f10a316035c853959f4ab8f0af1fd068f7d433679411a41579b8c2349ea682fa","observation_id":"f2874805-4f77-44d8-b850-80460e13eee6","resolution":{"observed_at":"2026-05-18T23:22:53.385458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef7ad157-a002-4799-b615-0900b0722957","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:8ac908c630862e36d976340c8df3094dd97b5d725df4dfa0c6357f70fd06cb21","observation_id":"ebb146e6-1bec-4afb-8cc2-c098974efa12","resolution":{"observed_at":"2026-05-18T23:22:53.427283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e0588189-26ce-4e4c-aba2-8f9525b573dd","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:38d867e3aea8abfdbe5e8a3bc2e7e0156753a49f346d4e517fc41e007179a27a","observation_id":"2c46ba44-9e2a-4796-9642-fbd5210221c2","resolution":{"observed_at":"2026-05-18T23:22:53.396683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All claims are empirical","venue":null,"work_id":"bb8eaa4a-485e-41f5-a752-c3d4b968fe93","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:8abc4df420561b312666eeb042c25891a6f070043df5e376383e15f8c90f7cc2","observation_id":"216edc78-548e-4b08-826a-6f569014b74b","resolution":{"observed_at":"2026-05-18T23:22:53.407714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Section 3.4 specifies infrastructure requirements (∼8,000 API calls, temperature=0)","venue":null,"work_id":"3ba59292-4934-49e0-8fc2-c311df260fb0","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:9ebc7c95a9251e80f4550f5f6a491ed4fc84d35830fcd7a7f45aa21c84bc08fa","observation_id":"9b8870bb-ef28-48ce-bcd4-3b7c9e756f0a","resolution":{"observed_at":"2026-05-18T23:22:53.416170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dataset files will be accessible there, and the Croissant metadata file is intended to be included as data/croissant metadata.json","venue":null,"work_id":"77d77bed-2b0f-4d78-b829-a7869ea116b0","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:b1554a477ca3f06255cdce05bd28f195f90bdab73ceca287f4b0fad190a8df67","observation_id":"69c5cf0c-7fd7-4067-a623-77d0f182bb36","resolution":{"observed_at":"2026-05-18T23:22:53.419839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All hyperparameters (temperature=0, wager scale 1–10, scoring rules) are specified","venue":null,"work_id":"0a011330-3274-4b8a-80f7-77beca480332","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:f96d277f78244b5c7acb97cf08b5e7ae2c3602dc4e1c5bf8657abdf838e98b08","observation_id":"38747487-bfd3-4b5a-a811-057232132f6f","resolution":{"observed_at":"2026-05-18T23:22:53.422420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effect sizes (Cohen’sd) and bootstrap p-values are reported for the three escalation curve comparisons","venue":null,"work_id":"7647bd38-4d4e-4530-818d-280c11182f2d","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:dfa906ac41fa0261e90c110892dece41c23b02f79ed58537ff7b83dd7c011c46","observation_id":"ac4a0f93-8426-4f5a-bf2d-4d75d8d2eba0","resolution":{"observed_at":"2026-05-18T23:22:53.424824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infrastructure: NVIDIA NIM (free tier), DeepSeek API, Google AI Studio","venue":null,"work_id":"91ebdbb7-6d33-4393-89e4-c325c1a9a3d7","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:ed3a68c619d46359b2535365bc153bd839014d10ffbbe1be54058feb081eb158","observation_id":"a75ade1b-5e89-4179-abd0-f65849b48119","resolution":{"observed_at":"2026-05-18T23:22:53.410330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Questions are factual across 8 cognitive domains","venue":null,"work_id":"b05d9403-69a4-44a1-9861-26e5efe38cb4","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:d17f4a40f39a2191a8d3c0e2c13b65fce79046ab4f104f1d4b1976dcaaa6d3c6","observation_id":"8d7b48ec-7dff-48b5-bcd7-a81b5dd671b2","resolution":{"observed_at":"2026-05-18T23:22:53.407118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Section 6.2 discusses Goodhart risk (models gaming MIRROR scores) and ecological validity limitations","venue":null,"work_id":"82489be2-8d3c-4556-af80-88a4be18aa2e","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:40a2b4ef2fdfb30cb1c991a3208631e0db691136a044b246e85ae243a12d8cb3","observation_id":"8530fa40-2926-4ca5-a151-edab2bfd1935","resolution":{"observed_at":"2026-05-18T23:22:53.403677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Versioned releases support periodic updates","venue":null,"work_id":"1d78ea06-274c-4ed2-b916-9042e05283f9","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:459a5a61c618bb2d57209569a8213fa2efe3696d6411423ac00b075e2ca9edcf","observation_id":"d012cbf9-5560-45ad-a922-515a3e56720c","resolution":{"observed_at":"2026-05-18T23:22:53.412894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The repository is released under the MIT License, which is also reflected in the Croissant metadata","venue":null,"work_id":"f1171c62-ce1d-458a-bc4d-2fb64f3cd40d","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:231323cf28c67a1fd3e453463cd47ae1926a1afd0913bebb8d2cad9fcc8d6e7f","observation_id":"61f93bfb-696a-4252-a5c0-9fbc143e9882","resolution":{"observed_at":"2026-05-18T23:22:53.395646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1376237-898b-4923-ac7c-713ced844b62","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:d35bd9ecdcf4dd7366a40aee4a34d14f0a8f8546364c412954a67f16bb0fde3c","observation_id":"e96fbb64-904e-4de1-b916-571c69d5ce8e","resolution":{"observed_at":"2026-05-18T23:22:53.390472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The human audit (Appendix W) was conducted by the authors","venue":null,"work_id":"2c111da2-bd60-4b52-9756-68a2d8c07849","year":null},"citing_paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T13:37:41.353329Z"},"links":{"citing_paper":"/paper/2604.19809"},"observation_digest":"sha256:662d76da94d56b460c8442e375b6a163bdd3c008461a50934644c047d06f8080","observation_id":"567ebbc7-feec-40b3-8e77-6814aaab0321","resolution":{"observed_at":"2026-05-18T23:22:53.410811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19809","last_updated":"2026-04-15T08:41:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-15T08:41:12Z","title":"MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2604.19809."}