{"as_of":"2026-08-05T20:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64a44f11432486c6a319ade9e957a1bb258e1f02dac50c9d66b4712c5fab9b1d","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:41:53.849176Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26102/citation-record","integrity":"/paper/2607.26102/integrity","json":"/paper/2607.26102/citation-record.json","paper":"/paper/2607.26102"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:50.700365Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:50.700365Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:163aa524552955c5c841744553041b8f8b55b73cbb287a0e68dafca23dd27105","observation_id":"16446460-0a45-4338-b6de-6041d2596f4d","resolution":{"observed_at":"2026-08-01T02:41:50.700365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:50.817858Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:50.817858Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:f9ea6c03ba600809a49e06287ff440c7c60681368a0bfeb64f765fef0fdfb567","observation_id":"2d31b836-828b-4711-9a36-b6d256bb1cc1","resolution":{"observed_at":"2026-08-01T02:41:50.817858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:50.893111Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of- thought prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:50.893111Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:396890d5b1ec611c42d0b283bb176c77480a0a8c552b84e3220e388ea7e77302","observation_id":"2ef6c58b-d963-4bf6-b26a-90781f73acfb","resolution":{"observed_at":"2026-08-01T02:41:50.893111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:50.975169Z","title":"Federated generative intelligence for explainable and autonomous cyber defence in critical infrastructures,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:50.975169Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:3c7e9ce70db54e39b7853d95e772ac14fc108b6d0c1e9a6f1a351b1f3ba94e35","observation_id":"06bc27f3-5fd7-42c4-ba11-503531c8f602","resolution":{"observed_at":"2026-08-01T02:41:50.975169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-01T02:41:51.171583Z","title":"Measuring faithfulness in chain-of-thought reason- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.171583Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:f28c36100b2c0d5c4bb70416bda551da3c68bd11da21e434d3f7c24222f43b49","observation_id":"a1ea8b0c-5f36-40ed-b395-37e7d3f453b4","resolution":{"observed_at":"2026-08-01T02:41:51.171583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T02:41:51.342440Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.342440Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:b8a2e40cada321643103b1bfb03aca40fe947b6e6eb677d47b5b344879a5f059","observation_id":"81e50c51-c0d7-49a5-83af-0160a179ab67","resolution":{"observed_at":"2026-08-01T02:41:51.342440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:51.449290Z","title":"Measuring mathematical problem solving with the MATH dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.449290Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:5a684be454e86e22888e3c26c930c84684394f5d1851dc6f5c296e90a2318be5","observation_id":"cb9e2ce9-471c-490d-ac5d-da24b6daa20c","resolution":{"observed_at":"2026-08-01T02:41:51.449290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-07-06T18:08:04.815730Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-01T02:41:51.475326Z","title":"GSM-Symbolic/GSM1K: Are large language models actually good at arithmetic reasoning?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.475326Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:0a2356c1c02ce190c2f7cfda1976383dd377a4aa2ba0efb273ee0a29078da165","observation_id":"4a7da1d2-2edf-481c-8d62-2e0872c13e61","resolution":{"observed_at":"2026-08-01T02:41:51.475326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:51.614360Z","title":"Agentic AI framework for autonomous and self-managing cloud services,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.614360Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:f5a4ab76bc732998a0a6c90cb06933cae0c74c05dc8b204baaa1db1b456d5dae","observation_id":"f09d010b-6dda-448c-8409-984d68cec4cd","resolution":{"observed_at":"2026-08-01T02:41:51.614360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:51.750526Z","title":"On measuring faithfulness or self- consistency of natural language explanations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.750526Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:71ed23da184a04928dd4697a1b5992c78ac7815de4575055bf2f21a390784d60","observation_id":"5189926f-6de6-4c5d-9a3d-c72bf80fb01e","resolution":{"observed_at":"2026-08-01T02:41:51.750526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:51.903167Z","title":"ROSCOE: A suite of metrics for scoring step-by- step reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.903167Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:30dfdd01a0b5f730cf350cfae426848fcda3e142bb1128bf40defcf98de58a74","observation_id":"76295650-45be-4ec4-a378-a6e94c3212b9","resolution":{"observed_at":"2026-08-01T02:41:51.903167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:52.035866Z","title":"DeBERTa: Decoding-enhanced BERT with disentangled attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:52.035866Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:24af2e882e45a401a42dc9ad31c4fad4d77314737d7bfb351b7c5a9c4ea34c65","observation_id":"fe00edda-5930-4fe9-b34c-524fc2528c07","resolution":{"observed_at":"2026-08-01T02:41:52.035866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:52.122552Z","title":"ReCEval: Evaluating reasoning chains via correctness and informativeness,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:52.122552Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:c5a458bacabe6ea6e4514402fd9fe0f52496bf59015d053bea4c759e40ac5c85","observation_id":"2ad813b1-e3bd-45cc-8dcb-7fa791cc1138","resolution":{"observed_at":"2026-08-01T02:41:52.122552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11277-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:46:11.077153Z","title":"On authentication schemes using polynomials over non commutative rings,","venue":null,"work_id":"e7405a29-26fc-4a97-a4cc-27a061512d20","year":2021},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:52.304612Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:4d38540c3122b8ad5a1b197327418f35baf4e5ab14f6c9c97e5feff2f20de413","observation_id":"9c07f871-3937-45d9-8c67-17757a48e9ba","resolution":{"observed_at":"2026-08-01T02:46:11.242397Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:52.458185Z","title":"A benchmark for verifiers of reasoning chains,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:52.458185Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:4ca461860b890bc8407f974c6ac04e6ff19e82a4a788f6c5924b3c124d820aa5","observation_id":"b7716dde-f6c6-4e4e-966e-8158fbc0d3c5","resolution":{"observed_at":"2026-08-01T02:41:52.458185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:52.612889Z","title":"Direct evaluation of chain-of-thought in multi-hop reasoning with knowledge graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:52.612889Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:49556dd3a65bb0bd94ecb41401df7f609139ef20ad3e68766c05370eee9f33dc","observation_id":"813cb8fc-300f-4cf8-9b68-dcd3c6aa2e23","resolution":{"observed_at":"2026-08-01T02:41:52.612889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1402.2024","last_updated":"2015-08-05T16:58:37Z","snapshot_observed_at":"2026-07-06T03:35:32.061872Z","submitted_at":"2014-02-10T03:14:15Z","title":"Self-adjointness of semi-relativistic Pauli-Fierz Hamiltonian","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1402.2024","snapshot_observed_at":"2026-08-01T02:41:52.825454Z","title":"Math- ematics and logics in ML: Application aspects,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:52.825454Z"},"links":{"cited_paper":"/paper/1402.2024","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:80426023f471291f26e966b2d805d9a852ea149f1efcbf442489b03a1988c357","observation_id":"3d78d6be-d91a-4c28-8e1b-988c2ea84ad2","resolution":{"observed_at":"2026-08-01T02:41:52.825454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:41:52.941251Z","title":"Making reasoning matter: Measuring and improving faithfulness of chain-of-thought rea- soning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:52.941251Z"},"links":{"citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:be12c76236b378c70f0aa527930d7be603fd2a48372b51c840602297c42b303d","observation_id":"cadcf317-82bb-467d-a790-e4c1c12978f8","resolution":{"observed_at":"2026-08-01T02:41:52.941251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18915","last_updated":"2025-05-31T11:18:02Z","snapshot_observed_at":"2026-07-06T18:21:52.950440Z","submitted_at":"2024-05-29T09:17:46Z","title":"Towards Better Chain-of-Thought: A Reflection on Effectiveness and Faithfulness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18915","snapshot_observed_at":"2026-08-01T02:41:53.089640Z","title":"Towards faithful chain-of-thought: Large language models are bridging reasoners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:53.089640Z"},"links":{"cited_paper":"/paper/2405.18915","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:497bd4bef1740fbe1c11fd5c785af4b2ce20c2a1110db5b4d5d18e9d2a52421e","observation_id":"3d9b508b-ab56-488a-95ac-76cd8a60a83d","resolution":{"observed_at":"2026-08-01T02:41:53.089640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-04T15:36:09.301591Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-01T02:41:53.202479Z","title":"ProcessBench: Identifying process errors in mathemat- ical reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:53.202479Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:0fa5cb2f29d35d89398a1136696281ca2d7fd1826ea2e34a32c76a92fa41e696","observation_id":"44a42c15-a6d0-4a29-acbd-39bd6d3e271a","resolution":{"observed_at":"2026-08-01T02:41:53.202479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-01T02:41:53.351709Z","title":"Reasoning models don’t always say what they think,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:53.351709Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:79c8eff43875427e8552e7e3068926dc07aced5e4ce52143f882fff2c6d5fb04","observation_id":"6339b64f-3029-4e7d-951b-f1526013122c","resolution":{"observed_at":"2026-08-01T02:41:53.351709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-07-06T20:50:51.469809Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-01T02:41:53.515878Z","title":"Chain-of-thought reasoning in the wild is not always faithful,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:53.515878Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:6a5b6f72e868050f3bfc854000b6032c09b179d378a5fde4ada217909bc59446","observation_id":"e7d0c5bc-7b1a-4d33-8a3a-a2e66e218315","resolution":{"observed_at":"2026-08-01T02:41:53.515878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T02:41:53.681811Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:53.681811Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:6109379eb80739fbcc6367c6224c985e796df5db0c49adf2bd4750aa95c4ab14","observation_id":"e680009d-7091-4440-93d3-8ef717e4fa51","resolution":{"observed_at":"2026-08-01T02:41:53.681811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T02:41:53.849176Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:53.849176Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:9539d5940c089e4a4a31d32f793bc75a62d07035e3d8b0c1fe9f67b475ce9b7a","observation_id":"9e6c368a-13f9-498d-8a55-51c82260292f","resolution":{"observed_at":"2026-08-01T02:41:53.849176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-03T03:26:50.537645Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.26102."}