{"as_of":"2026-08-07T20:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a68d5387446a1b6bc27235601d6337b0abf06790e0b1f04f9ddc0ff182f4149b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:52:41.500608Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T16:53:40.544660Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-07T12:52:41.500608Z","title":"Benchmarking reasoning robustness in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23275","last_updated":"2025-05-29T09:23:11Z","snapshot_observed_at":"2026-08-07T12:46:33.785042Z","submitted_at":"2025-05-29T09:23:11Z","title":"Wireless Agentic AI with Retrieval-Augmented Multimodal Semantic Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.500608Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2505.23275"},"observation_digest":"sha256:3d2362e8a7ed1a8654e7b429928cdaf65084e161926925d41c0d1076fc11e4f6","observation_id":"ece21f9f-633a-43c6-9300-958f80c86e96","resolution":{"observed_at":"2026-08-07T12:52:41.500608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.04550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-06-29T16:53:40.544660Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":"98a2ee94-365f-4718-8a68-3a4e88e7d151","year":2025},"citing_paper":{"arxiv_id":"2506.17788","last_updated":"2026-04-10T15:38:19Z","snapshot_observed_at":"2026-08-03T00:01:47.746581Z","submitted_at":"2025-06-21T18:45:28Z","title":"Bayesian Social Deduction with Graph-Informed Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T07:27:20.027179Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2506.17788"},"observation_digest":"sha256:b1f3515540ddec99430423ef0267fc51af4d4510751b88729c9c43ce13a65c39","observation_id":"addce766-70cb-442f-9db5-af65c27dccac","resolution":{"observed_at":"2026-05-19T07:32:09.373274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-06T22:21:11.584043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02938","last_updated":"2025-06-27T04:16:53Z","snapshot_observed_at":"2026-08-06T22:14:16.417610Z","submitted_at":"2025-06-27T04:16:53Z","title":"A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:21:11.584043Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2507.02938"},"observation_digest":"sha256:107d4997912ec7c55a86c1c4c0dd061a367db3a130c7575ec820cd044667b42e","observation_id":"a99acdcf-a909-44f6-afdf-ec0a1265bd8d","resolution":{"observed_at":"2026-08-06T22:21:11.584043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-06T19:58:37.741861Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04142","last_updated":"2025-07-05T19:43:54Z","snapshot_observed_at":"2026-08-06T19:52:02.081681Z","submitted_at":"2025-07-05T19:43:54Z","title":"Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:58:37.741861Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2507.04142"},"observation_digest":"sha256:dc8bcedc0c53a23eacedba3d36e40d913d3152767feb33a1bb5b8be50eae474d","observation_id":"3b6d29b8-3d4f-40aa-a26c-e2931ad03d7c","resolution":{"observed_at":"2026-08-06T19:58:37.741861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-06T16:17:41.606874Z","title":"Benchmarking Reasoning Robustness in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13966","last_updated":"2025-09-01T20:28:13Z","snapshot_observed_at":"2026-08-06T19:48:02.316765Z","submitted_at":"2025-07-18T14:30:08Z","title":"Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:41.606874Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2507.13966"},"observation_digest":"sha256:089223eb4561159c21b14627485666729f20ce6076a8160ec524d47ba4a037a0","observation_id":"343f7b8a-0f47-48cc-a7ea-b84176a34a89","resolution":{"observed_at":"2026-08-06T16:17:41.606874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-05T23:03:10.164969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-06T16:03:13.511884Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:10.164969Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:61314afa611110ec779b8ed4feb4c9827479b687478d74951072d3813c9e8c11","observation_id":"ab2b6813-c8b3-4b9b-b62b-dc614589eade","resolution":{"observed_at":"2026-08-05T23:03:10.164969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-05T12:28:05.016955Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01619","last_updated":"2025-09-01T16:56:16Z","snapshot_observed_at":"2026-08-05T12:28:01.184798Z","submitted_at":"2025-09-01T16:56:16Z","title":"Throttling Web Agents Using Reasoning Gates","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:05.016955Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2509.01619"},"observation_digest":"sha256:c623cef776432491e622ef5786aea80f537f70a12460212bb27269d8cb17feaa","observation_id":"49485f00-064e-4416-8d89-69c43dac6161","resolution":{"observed_at":"2026-08-05T12:28:05.016955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-05T10:39:07.143764Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-06T11:50:02.157285Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":189,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:07.143764Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:abd4fafb18d4926b367bc62ae5333e84ac011570ac5e437020212aa0a676557c","observation_id":"e460ba93-291d-45bf-97f4-e0a883657636","resolution":{"observed_at":"2026-08-05T10:39:07.143764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.04550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-06-29T16:53:40.544660Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":"98a2ee94-365f-4718-8a68-3a4e88e7d151","year":2025},"citing_paper":{"arxiv_id":"2602.16990","last_updated":"2026-05-17T16:40:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-19T01:29:50Z","title":"Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T12:18:18.407788Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2602.16990"},"observation_digest":"sha256:c6cfd5eec8e6ac1fa23e65becbd2c533717db38abb2413181b4c269252b89dcf","observation_id":"21109c5e-c722-4689-b483-84b58368f1a7","resolution":{"observed_at":"2026-05-21T12:20:06.816253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.04550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-06-29T16:53:40.544660Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":"98a2ee94-365f-4718-8a68-3a4e88e7d151","year":2025},"citing_paper":{"arxiv_id":"2605.11636","last_updated":"2026-05-12T06:58:35Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:58:35Z","title":"Seir\\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:49.761472Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2605.11636"},"observation_digest":"sha256:1e1be96d92971e4b33fbf59af6c70dfae65a8a062d194444a5e32e0d0d7b766e","observation_id":"985e2736-6776-4983-a8be-cc8b35157f77","resolution":{"observed_at":"2026-05-13T01:22:01.794846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.04550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-06-29T16:53:40.544660Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":"98a2ee94-365f-4718-8a68-3a4e88e7d151","year":2025},"citing_paper":{"arxiv_id":"2605.27209","last_updated":"2026-05-26T16:02:00Z","snapshot_observed_at":"2026-08-03T11:00:10.339186Z","submitted_at":"2026-05-26T16:02:00Z","title":"Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T16:51:36.524194Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2605.27209"},"observation_digest":"sha256:83dac10470730fc623da978cb809d081c7a31990f228e187f480202b3744ec59","observation_id":"6c9f0343-f6fb-446a-a119-2f5a828c2255","resolution":{"observed_at":"2026-06-29T16:53:40.546212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-02T05:48:55.417781Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-04T18:32:43.341301Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.417781Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:bdc3419f312fb57873e3af262f3ef3cda39d51b9877a12c55caa41051eafaac7","observation_id":"827760a3-26cf-493a-a2ca-eebe1f86bf14","resolution":{"observed_at":"2026-08-02T05:48:55.417781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-02T02:44:22.985400Z","title":"arXiv preprint arXiv:2503.04550 , doi =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14242","last_updated":"2026-07-15T18:03:08Z","snapshot_observed_at":"2026-08-06T07:44:58.399871Z","submitted_at":"2026-07-15T18:03:08Z","title":"Implicit Reasoning Steering via Concept Chaining","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T02:44:22.985400Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2607.14242"},"observation_digest":"sha256:0b2f3d2daf3b8cdb765c12017a09558dab6841426ae5bf7d8b71c2794ed23350","observation_id":"07a6f5f0-324f-4787-9690-08dd164475b6","resolution":{"observed_at":"2026-08-02T02:44:22.985400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-02T02:44:37.046778Z","title":"Benchmarking Reasoning Robustness in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14242","last_updated":"2026-07-15T18:03:08Z","snapshot_observed_at":"2026-08-06T07:44:58.399871Z","submitted_at":"2026-07-15T18:03:08Z","title":"Implicit Reasoning Steering via Concept Chaining","version":1},"reference_index":186,"source":"arxiv_source","source_observed_at":"2026-08-02T02:44:37.046778Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2607.14242"},"observation_digest":"sha256:e5519061295ab90a0f0183d5dd762d03fe523bea10629f0b2a7b523aa484ffa3","observation_id":"81fb91db-cea3-4b1d-af33-11f627ce29fd","resolution":{"observed_at":"2026-08-02T02:44:37.046778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.04550/citation-record","integrity":"/paper/2503.04550/integrity","json":"/paper/2503.04550/citation-record.json","paper":"/paper/2503.04550"},"outbound":[],"paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T17:24:22.454511Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2503.04550."}