{"as_of":"2026-08-08T05:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fcf1dac770f98ba7d93015ce848b08a1cfc3ce94b1f3ef01a19e47f92534dea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:26.602021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:27:26.723998Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2410.04047","last_updated":"2026-04-10T06:16:18Z","snapshot_observed_at":"2026-07-06T19:28:18.775189Z","submitted_at":"2024-10-05T06:04:19Z","title":"TS-Reasoner: Domain-Oriented Time Series Inference Agents for Reasoning and Automated Analysis","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T19:45:39.130509Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2410.04047"},"observation_digest":"sha256:7fed877e2f1e5648375e0cd605702e9b63810bfb2b1d94475b63a0247b752dc3","observation_id":"d1afb69a-6236-47d2-8128-61707e539603","resolution":{"observed_at":"2026-05-23T19:45:47.180451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2412.15931","last_updated":"2026-05-05T15:18:33Z","snapshot_observed_at":"2026-07-06T20:10:56.727212Z","submitted_at":"2024-12-20T14:23:25Z","title":"Large Language Model assisted Hybrid Fuzzing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T07:13:13.613187Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2412.15931"},"observation_digest":"sha256:1c876132e4df20582b6c8902ee39c656d57ca6c52e06ce5ab7a1a8c0f879cb5d","observation_id":"c436901c-6679-44ae-b83f-896fa2f89fb7","resolution":{"observed_at":"2026-05-23T07:15:28.694964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2506.06211","last_updated":"2026-04-21T03:40:06Z","snapshot_observed_at":"2026-08-03T01:28:16.465454Z","submitted_at":"2025-06-06T16:17:09Z","title":"PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T10:43:02.601014Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2506.06211"},"observation_digest":"sha256:1f2963f2e7c2a72ec2a77c04a7b6f7bfa9bef2d7fb7b38e01ef5ea3072a6b4c7","observation_id":"18926fbe-dfa6-4174-bbb5-84dc97c31bec","resolution":{"observed_at":"2026-05-19T10:47:15.149914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-07T05:51:08.241334Z","title":"and Plank, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06971","last_updated":"2025-06-12T14:47:31Z","snapshot_observed_at":"2026-08-07T07:20:17.397323Z","submitted_at":"2025-06-08T02:43:46Z","title":"Chain-of-Code Collapse: Reasoning Failures in LLMs via Adversarial Prompting in Code Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:51:08.241334Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2506.06971"},"observation_digest":"sha256:b653ff46efe3f5b52026e3dac94968eee19ceb7a11f6305dc6f24e0dde016ad2","observation_id":"5eae57af-4b47-48db-ac84-34593590a22b","resolution":{"observed_at":"2026-08-07T05:51:08.241334Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-07T05:08:57.700850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08978","last_updated":"2025-06-10T16:46:05Z","snapshot_observed_at":"2026-08-07T04:55:25.042010Z","submitted_at":"2025-06-10T16:46:05Z","title":"Propositional Logic for Probing Generalization in Neural Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:08:57.700850Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2506.08978"},"observation_digest":"sha256:b2c3a027376c8e8f88bcefcf66210e9fe96dba7adb71494c7fc5d6a33bd0cc27","observation_id":"ee5f1057-1385-4871-b8bd-00f9d536a1e2","resolution":{"observed_at":"2026-08-07T05:08:57.700850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-07T10:17:26.602021Z","title":"Beyond accuracy: Evaluating the rea- soning behavior of large language models–a survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.602021Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:8ee9dc187eb548a1b75e06e2ae0309629a642123e817da1b46b920cf07e12f4d","observation_id":"3608d722-55aa-45b5-8579-e4e6c896ec9e","resolution":{"observed_at":"2026-08-07T10:17:26.602021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-06T22:36:23.526141Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models – a survey.arXiv preprint arXiv:2404.01869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21215","last_updated":"2025-06-26T13:11:01Z","snapshot_observed_at":"2026-08-07T10:37:00.427385Z","submitted_at":"2025-06-26T13:11:01Z","title":"Unveiling Causal Reasoning in Large Language Models: Reality or Mirage?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:23.526141Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2506.21215"},"observation_digest":"sha256:670f8a1c9460404a0b4abbc8b8c2aa02280ec540cf7a3727a45742ddd2abf31a","observation_id":"0665d821-a98b-4193-949d-93d704d56573","resolution":{"observed_at":"2026-08-06T22:36:23.526141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-06T21:58:22.769487Z","title":"14 Philipp Mondorf and Barbara Plank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22957","last_updated":"2025-08-27T20:38:04Z","snapshot_observed_at":"2026-08-08T00:28:19.441824Z","submitted_at":"2025-06-28T17:22:59Z","title":"Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:22.769487Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2506.22957"},"observation_digest":"sha256:a082e34f9884c465180db5cc8dd7e85a4d91a2a850197d080c55709f2ce72411","observation_id":"c30afdeb-77fb-4f63-aa54-b3bce31efbbd","resolution":{"observed_at":"2026-08-06T21:58:22.769487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-06T19:58:36.232363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04142","last_updated":"2025-07-05T19:43:54Z","snapshot_observed_at":"2026-08-06T19:52:02.081681Z","submitted_at":"2025-07-05T19:43:54Z","title":"Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:58:36.232363Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2507.04142"},"observation_digest":"sha256:c0f07858d0cd587dc9f80aa2d2ba9db7326d1c8e244338ff1c5c06d79ce0fd2e","observation_id":"0201270e-fd6e-4c99-a112-338a45d35d92","resolution":{"observed_at":"2026-08-06T19:58:36.232363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-06T14:45:42.582894Z","title":"Beyond accuracy: evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18182","last_updated":"2025-08-04T15:53:52Z","snapshot_observed_at":"2026-08-06T14:36:11.929749Z","submitted_at":"2025-07-24T08:28:17Z","title":"SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:42.582894Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2507.18182"},"observation_digest":"sha256:3b291cabac4cd9211502d61a3d6933f33fc209f517297430121b1975ada93d02","observation_id":"8d2d8d73-ee8e-4180-82a9-32fcbcc1dac6","resolution":{"observed_at":"2026-08-06T14:45:42.582894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-06T05:41:42.094226Z","title":"Mondorf and B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-06T05:41:40.989098Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.094226Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:a5a56c1ffaa445b00153d8fcab7b99da571bb4e9bf23510ea26285e4eb395ac9","observation_id":"a9029285-c2f9-4d4c-82fa-3c3c26941291","resolution":{"observed_at":"2026-08-06T05:41:42.094226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-05T11:46:53.218414Z","title":"In 2024 IEEE Intelligent Vehicles Symposium (IV) , pages 1206–1213","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02292","last_updated":"2026-06-28T02:36:12Z","snapshot_observed_at":"2026-08-05T11:46:52.768597Z","submitted_at":"2025-09-02T13:11:24Z","title":"LLMs and their Limited Theory of Mind: Evaluating Mental State Annotations in Situated Dialogue","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:46:53.218414Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2509.02292"},"observation_digest":"sha256:f86462400a7e98dff045cd477c3eb5d3637f31244796ce8e37b5a9337974275b","observation_id":"3f16f27d-be57-49ad-8229-e64dba374242","resolution":{"observed_at":"2026-08-05T11:46:53.218414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-03T17:53:55.547037Z","title":"and Plank, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07795","last_updated":"2026-05-30T17:04:27Z","snapshot_observed_at":"2026-08-07T13:27:56.350968Z","submitted_at":"2025-12-08T18:26:58Z","title":"ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:53:55.547037Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2512.07795"},"observation_digest":"sha256:e4c058479b58e05e5c4d7082a3e0a2b7045be3cf47c1d18505173f5beddf5f41","observation_id":"18f575ae-5a69-4698-a01e-48370b28e9fa","resolution":{"observed_at":"2026-08-03T17:53:55.547037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2603.03332","last_updated":"2026-04-16T23:41:41Z","snapshot_observed_at":"2026-08-04T02:21:24.392691Z","submitted_at":"2026-02-11T03:11:30Z","title":"Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T03:43:18.987241Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2603.03332"},"observation_digest":"sha256:b67cbd526f21f879e632169a56e32a1b603687bee56b5e747a9995dd4a42d58a","observation_id":"d019ff42-c5a4-4de4-a718-a161f8264ee1","resolution":{"observed_at":"2026-05-16T03:47:15.358111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2604.13371","last_updated":"2026-04-15T00:35:22Z","snapshot_observed_at":"2026-08-02T09:56:14.451966Z","submitted_at":"2026-04-15T00:35:22Z","title":"Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T14:12:45.438246Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2604.13371"},"observation_digest":"sha256:755d9b5164b10396296bde2013bfc48e27a3d042371d7328c1ce5b336ebfcf44","observation_id":"e57b035f-3313-4c7f-9912-7c9a63b2e998","resolution":{"observed_at":"2026-05-10T14:15:29.419676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2605.02442","last_updated":"2026-05-04T10:42:26Z","snapshot_observed_at":"2026-07-30T10:52:38.632184Z","submitted_at":"2026-05-04T10:42:26Z","title":"Measuring AI Reasoning: A Guide for Researchers","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-08T18:53:18.586923Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2605.02442"},"observation_digest":"sha256:d8eebeb089e7a9ec95e63309e03fa20866af3855c7702b304f7519e1876c7a71","observation_id":"5e95860f-12fd-4d31-8e4b-8cc8a0e2b51c","resolution":{"observed_at":"2026-05-09T06:05:36.704850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2605.08142","last_updated":"2026-05-02T10:41:20Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-02T10:41:20Z","title":"Reasoning emerges from constrained inference manifolds in large language models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:58:30.713839Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2605.08142"},"observation_digest":"sha256:8a77c67b3cd9b6632577e056fd9ffb791aad8954c0b0d89d0a8fed2e3e3c1330","observation_id":"5477db6f-4f37-47e1-9e7d-fbf2e56e0112","resolution":{"observed_at":"2026-05-12T02:01:15.379951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2605.22137","last_updated":"2026-05-25T06:02:57Z","snapshot_observed_at":"2026-08-06T07:47:49.236941Z","submitted_at":"2026-05-21T08:11:01Z","title":"Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-30T17:31:39.958584Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2605.22137"},"observation_digest":"sha256:de66d3ddd64d7e81a3ebfdb706724618636ca869a510d9738ebc9287f3629fc3","observation_id":"2700da80-4028-4f46-96d9-30ebecdca0d8","resolution":{"observed_at":"2026-06-30T17:34:57.575582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2605.24213","last_updated":"2026-05-22T20:54:30Z","snapshot_observed_at":"2026-08-02T06:58:01.300783Z","submitted_at":"2026-05-22T20:54:30Z","title":"Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T14:41:07.354007Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2605.24213"},"observation_digest":"sha256:16b341af9d41fddd60381f101b8b4ab43127102136c2ddf2c854a6ee24c57e56","observation_id":"2af6ec53-3384-4746-b4df-6e62da89311e","resolution":{"observed_at":"2026-06-30T14:44:45.106736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2605.24661","last_updated":"2026-07-01T08:31:40Z","snapshot_observed_at":"2026-08-03T01:04:22.766287Z","submitted_at":"2026-05-23T17:03:42Z","title":"Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T13:27:50.367497Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2605.24661"},"observation_digest":"sha256:4a9b601311bd5ac277c0b62c31dac421f087ac42f61a2c1b9203d609f680010c","observation_id":"a18e703d-5e5b-4251-957c-40f7849ac7ab","resolution":{"observed_at":"2026-06-30T13:34:40.593743Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2605.24661","last_updated":"2026-07-01T08:31:40Z","snapshot_observed_at":"2026-08-03T01:04:22.766287Z","submitted_at":"2026-05-23T17:03:42Z","title":"Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T07:35:51.017797Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2605.24661"},"observation_digest":"sha256:92266ce4db7ea0f09b1ff389aba90802b3a71614286340df856d817e320ca31e","observation_id":"480fcf42-782a-47c0-903a-d240184b144c","resolution":{"observed_at":"2026-07-01T08:05:31.924167Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":"2404.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-07-02T23:27:26.723998Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":"3a4fe640-6dab-4721-8777-18e6b5af6ad1","year":2024},"citing_paper":{"arxiv_id":"2605.24661","last_updated":"2026-07-01T08:31:40Z","snapshot_observed_at":"2026-08-03T01:04:22.766287Z","submitted_at":"2026-05-23T17:03:42Z","title":"Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T23:22:08.567841Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2605.24661"},"observation_digest":"sha256:4617aacc41c0c79971e13a0d274de845107df35e40b64569dbfe94ac5f1f60ee","observation_id":"157347d4-b946-48ce-b33b-6149dfa131a4","resolution":{"observed_at":"2026-07-02T23:27:26.725939Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.01869/citation-record","integrity":"/paper/2404.01869/integrity","json":"/paper/2404.01869/citation-record.json","paper":"/paper/2404.01869"},"outbound":[],"paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T13:02:37.475538Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2404.01869."}