{"as_of":"2026-08-18T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9edc927e0621795ba2f90d5eecf494c3cd72da12a7f559a8861fe1c8ca346920","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:36:46.216027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T19:07:17.629184Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-11T17:37:05.300917Z","title":"Wang and Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08805","last_updated":"2025-05-29T16:48:53Z","snapshot_observed_at":"2026-08-17T17:01:18.574540Z","submitted_at":"2024-12-11T22:37:45Z","title":"Generative Agents for Multi-Agent Autoformalization of Interaction Scenarios","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:37:05.300917Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2412.08805"},"observation_digest":"sha256:382117434bf8a68b9f2374a20ef8bb47fcc0dc1b9616fb762f25cb3eba3ecf6c","observation_id":"6966cf7e-bc05-4e2f-82bd-9e14df86f8a6","resolution":{"observed_at":"2026-08-11T17:37:05.300917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-09T12:00:32.978837Z","title":"Wang and Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04352","last_updated":"2025-08-25T08:34:46Z","snapshot_observed_at":"2026-08-15T23:20:28.654528Z","submitted_at":"2025-02-04T17:16:51Z","title":"Investigating the Robustness of Deductive Reasoning with Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T12:00:32.978837Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2502.04352"},"observation_digest":"sha256:6ce0e144b83d2a295cf69d36da3ad4e51f55a2a4cbf92f8dac9fc297cf1926c4","observation_id":"4aeaf685-397b-4fd3-a57d-7c85cfd8e104","resolution":{"observed_at":"2026-08-09T12:00:32.978837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-16T10:36:46.216027Z","title":"https://arxiv.org/abs/2406.11020","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17723","last_updated":"2025-07-24T08:03:09Z","snapshot_observed_at":"2026-08-18T07:07:02.037816Z","submitted_at":"2025-04-24T16:36:19Z","title":"Statistical Runtime Verification for LLMs via Robustness Estimation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T10:36:46.216027Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2504.17723"},"observation_digest":"sha256:004b37a58d0c5ca20a5a6dae0f305fc5c9f61c77caf3678bc617826a5fc40a99","observation_id":"aa4dcf69-077d-49ba-8cdc-3ef7994a1ff0","resolution":{"observed_at":"2026-08-16T10:36:46.216027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-05T10:39:07.110033Z","title":"Rupbench: Benchmarking reasoning under perturbations for robustness evaluation in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":181,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:07.110033Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:d5d52a9979fca45f932c950f29011a32874c7c6114da2717671b176a5cca86e0","observation_id":"4ce7da9e-3f97-470c-a0c5-91b59f47040e","resolution":{"observed_at":"2026-08-05T10:39:07.110033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-03T17:53:56.270756Z","title":"R., Zhang, S., Sun, Y ., and Wang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07795","last_updated":"2026-05-30T17:04:27Z","snapshot_observed_at":"2026-08-15T09:08:17.333981Z","submitted_at":"2025-12-08T18:26:58Z","title":"ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:53:56.270756Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2512.07795"},"observation_digest":"sha256:e6ac2140d582c459f7c636dadd19b0c337ae35ca11db7f6469f4d3485801ea8d","observation_id":"cb2b3ddc-6b9f-499f-924c-71350f93ab6e","resolution":{"observed_at":"2026-08-03T17:53:56.270756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-02T22:32:02.429944Z","title":"and Zhao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-17T08:10:23.951809Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:02.429944Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:f73ecb2680ee0bd3a9f420626cd20d3b040d302a776745cc1989755e2698eca3","observation_id":"ed6e48bb-5ca5-437e-bea2-6117ceec8fb8","resolution":{"observed_at":"2026-08-02T22:32:02.429944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.11020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-07-02T19:07:17.629184Z","title":"Rupbench: Benchmarking reasoning under perturbations for robustness evaluation in large language models","venue":null,"work_id":"d4eb57e2-de2e-49c2-945f-4dedf92cc4be","year":2024},"citing_paper":{"arxiv_id":"2605.07053","last_updated":"2026-05-26T07:47:31Z","snapshot_observed_at":"2026-08-16T02:39:28.754955Z","submitted_at":"2026-05-08T00:02:39Z","title":"GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-11T00:57:55.616036Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2605.07053"},"observation_digest":"sha256:e908b7e6ab34cad35f208288afdb03d8095fdffc8fe285ffe8688397e78dcdce","observation_id":"786d5343-04c4-40a3-87fe-ee41f2fe97df","resolution":{"observed_at":"2026-05-11T04:55:59.848096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.11020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-07-02T19:07:17.629184Z","title":"Rupbench: Benchmarking reasoning under perturbations for robustness evaluation in large language models","venue":null,"work_id":"d4eb57e2-de2e-49c2-945f-4dedf92cc4be","year":2024},"citing_paper":{"arxiv_id":"2605.07053","last_updated":"2026-05-26T07:47:31Z","snapshot_observed_at":"2026-08-16T02:39:28.754955Z","submitted_at":"2026-05-08T00:02:39Z","title":"GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-30T23:42:00.965554Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2605.07053"},"observation_digest":"sha256:4c83e7ae6a8e002b12afa77385e77802c8b58f5d554d4cb3a3622c42f30631ca","observation_id":"632b6b7c-1189-41fa-a37c-072bbc04f0e9","resolution":{"observed_at":"2026-06-30T23:45:07.992954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.11020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-07-02T19:07:17.629184Z","title":"Rupbench: Benchmarking reasoning under perturbations for robustness evaluation in large language models","venue":null,"work_id":"d4eb57e2-de2e-49c2-945f-4dedf92cc4be","year":2024},"citing_paper":{"arxiv_id":"2605.11636","last_updated":"2026-05-12T06:58:35Z","snapshot_observed_at":"2026-08-12T20:17:56.417016Z","submitted_at":"2026-05-12T06:58:35Z","title":"Seir\\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:49.761472Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2605.11636"},"observation_digest":"sha256:859188af4d5863fa416c95d2210d6880c7004abd3a1e12ac6746adfcace85931","observation_id":"d13b6aa6-beb6-4b4b-80fb-57dd5289f287","resolution":{"observed_at":"2026-05-13T01:22:01.650069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.11020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-07-02T19:07:17.629184Z","title":"Rupbench: Benchmarking reasoning under perturbations for robustness evaluation in large language models","venue":null,"work_id":"d4eb57e2-de2e-49c2-945f-4dedf92cc4be","year":2024},"citing_paper":{"arxiv_id":"2606.07237","last_updated":"2026-06-05T13:07:11Z","snapshot_observed_at":"2026-08-18T00:11:41.165987Z","submitted_at":"2026-06-05T13:07:11Z","title":"When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:41:20.354463Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2606.07237"},"observation_digest":"sha256:4b120dc3e3729294d548400b822b1494613652dad25817686694b6b9abaa6b99","observation_id":"2b5dec2f-bf4f-42e9-a639-87bacd7473c5","resolution":{"observed_at":"2026-07-02T19:07:17.630636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-02T02:44:22.745849Z","title":"arXiv preprint arXiv:2406.11020 , doi =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14242","last_updated":"2026-07-15T18:03:08Z","snapshot_observed_at":"2026-08-14T09:53:27.449814Z","submitted_at":"2026-07-15T18:03:08Z","title":"Implicit Reasoning Steering via Concept Chaining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T02:44:22.745849Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2607.14242"},"observation_digest":"sha256:15f583f9133351274d785a756815cf61dd72ede1cb5d3e3741dbf5fab302c2ff","observation_id":"32d1364f-0811-4c0b-b22c-bc37564cea51","resolution":{"observed_at":"2026-08-02T02:44:22.745849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-02T02:44:36.232661Z","title":"RUPBench : Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14242","last_updated":"2026-07-15T18:03:08Z","snapshot_observed_at":"2026-08-14T09:53:27.449814Z","submitted_at":"2026-07-15T18:03:08Z","title":"Implicit Reasoning Steering via Concept Chaining","version":1},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-08-02T02:44:36.232661Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2607.14242"},"observation_digest":"sha256:6183cf5d69e10e0c671e52eb102c8bc709741af9d3420a7af580ff6d14edf9eb","observation_id":"525f9cf0-1081-4e5c-9915-8614244d99de","resolution":{"observed_at":"2026-08-02T02:44:36.232661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-01T10:47:04.252559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20115","last_updated":"2026-07-22T13:19:58Z","snapshot_observed_at":"2026-08-17T21:01:50.047402Z","submitted_at":"2026-07-22T13:19:58Z","title":"Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T10:47:04.252559Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2607.20115"},"observation_digest":"sha256:14b0187c4aeaea30c80a8bd92763628c1316752cf4781021e1e63a9901d41876","observation_id":"65bb48e2-b5b4-44b8-8708-0e44caf57646","resolution":{"observed_at":"2026-08-01T10:47:04.252559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-07-30T22:40:44.589052Z","title":"arXiv preprint arXiv:2406.11020 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-16T22:17:22.286078Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-30T22:40:44.589052Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:d29f25b8153aa6a91d3b973248e79a9216bab945e90ae9538f62b7947597761b","observation_id":"bbcbfa2d-e625-4dfc-81af-1e632d639675","resolution":{"observed_at":"2026-07-30T22:40:44.589052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-07-31T23:42:26.014902Z","title":"arXiv preprint arXiv:2406.11020 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-16T22:17:22.286078Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T23:42:26.014902Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:f458f48d095f763b3ebef01b48db1637c6f0f3f4ec7fe2b73f9e61b9627f9870","observation_id":"66ad5cfa-ba6c-4d63-835b-bfe1016bfa12","resolution":{"observed_at":"2026-07-31T23:42:26.014902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-03T01:52:38.577316Z","title":"arXiv preprint arXiv:2406.11020 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-16T22:17:22.286078Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.577316Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:ba63eebcf45618c44a0b350b90c50e6f3913dd73ca8013cc0d62457ef11f5164","observation_id":"b58994f9-d4e6-4c6d-94d9-884a55ac8053","resolution":{"observed_at":"2026-08-03T01:52:38.577316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-05T20:45:24.247556Z","title":"arXiv preprint arXiv:2406.11020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-16T03:23:56.461105Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.247556Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:6fe88c0d2222304daddff12c7e76f1693b1b12a44a51ffa84dd30f74e294545c","observation_id":"311eb501-d071-4230-9228-4c7e3f35a4eb","resolution":{"observed_at":"2026-08-05T20:45:24.247556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.11020/citation-record","integrity":"/paper/2406.11020/integrity","json":"/paper/2406.11020/citation-record.json","paper":"/paper/2406.11020"},"outbound":[],"paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:42:31.350177Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2406.11020."}