{"as_of":"2026-08-23T07:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1973801886d800297d936b9e6e976bd9db9cc14ad0efa5eb2ec756d50026a7c2","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:39:05.842706Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:40:57.907170Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:49:51.497057Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-07-04T13:49:51.497057Z","title":"Reasoning model unlearning: Forgetting traces, not just answers, while preserving rea- soning skills","venue":null,"work_id":"b03eee68-ca5f-4b3c-b98d-fd6922740e5b","year":2025},"citing_paper":{"arxiv_id":"2602.11528","last_updated":"2026-04-18T03:07:48Z","snapshot_observed_at":"2026-08-13T01:24:19.741090Z","submitted_at":"2026-02-12T03:37:50Z","title":"Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T05:22:59.050348Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2602.11528"},"observation_digest":"sha256:4b92920f947d9c202448eb365578d42f81fbe7c4ef0f54a0b2667f0bbb987fd1","observation_id":"6529f910-4f45-4646-b22d-8b94c3ae006a","resolution":{"observed_at":"2026-05-16T05:27:23.292121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-07-04T13:49:51.497057Z","title":"Reasoning model unlearning: Forgetting traces, not just answers, while preserving rea- soning skills","venue":null,"work_id":"b03eee68-ca5f-4b3c-b98d-fd6922740e5b","year":2025},"citing_paper":{"arxiv_id":"2604.04852","last_updated":"2026-04-06T16:53:52Z","snapshot_observed_at":"2026-08-17T08:48:29.317268Z","submitted_at":"2026-04-06T16:53:52Z","title":"Strengthening Human-Centric Chain-of-Thought Reasoning Integrity in LLMs via a Structured Prompt Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:53:12.473010Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2604.04852"},"observation_digest":"sha256:5a40c7439b7ab9ae5a37ccfb225dbcccd2c431027578e53de62579115d22452f","observation_id":"dfa30600-790c-40a8-87a8-3eddea1fb926","resolution":{"observed_at":"2026-05-10T23:45:52.713221Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-07-04T13:49:51.497057Z","title":"Reasoning model unlearning: Forgetting traces, not just answers, while preserving rea- soning skills","venue":null,"work_id":"b03eee68-ca5f-4b3c-b98d-fd6922740e5b","year":2025},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-08-11T21:11:54.456177Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:c9065245678638e771f61aa6cb93fa797cb53264996e87571247a48b1cd9c159","observation_id":"b32d8cb4-6b38-4187-9c65-dddf41cf8eb7","resolution":{"observed_at":"2026-05-11T11:41:04.152717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-07-04T13:49:51.497057Z","title":"Reasoning model unlearning: Forgetting traces, not just answers, while preserving rea- soning skills","venue":null,"work_id":"b03eee68-ca5f-4b3c-b98d-fd6922740e5b","year":2025},"citing_paper":{"arxiv_id":"2604.19656","last_updated":"2026-04-21T16:45:29Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:45:29Z","title":"Pause or Fabricate? Training Language Models for Grounded Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T03:01:58.366028Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2604.19656"},"observation_digest":"sha256:be63e2f4cbe5d5b1c4b77bc1257770bb6498803fe55ef4c54ae5c1837f52ea6f","observation_id":"10f6d2b5-7061-4305-af0d-f0e670375250","resolution":{"observed_at":"2026-05-11T12:46:05.200951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-07-04T13:49:51.497057Z","title":"Reasoning model unlearning: Forgetting traces, not just answers, while preserving rea- soning skills","venue":null,"work_id":"b03eee68-ca5f-4b3c-b98d-fd6922740e5b","year":2025},"citing_paper":{"arxiv_id":"2605.18891","last_updated":"2026-05-17T05:22:27Z","snapshot_observed_at":"2026-08-12T15:49:44.729844Z","submitted_at":"2026-05-17T05:22:27Z","title":"Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T14:10:50.885027Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2605.18891"},"observation_digest":"sha256:157a0b1f1271ed4ad5f5c153ce88f872e9c18a58102ab482edd8c856b10acaba","observation_id":"9f7f2ab7-39d7-41c1-83be-508b2090a737","resolution":{"observed_at":"2026-05-20T14:13:21.269444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-07-04T13:49:51.497057Z","title":"Reasoning model unlearning: Forgetting traces, not just answers, while preserving rea- soning skills","venue":null,"work_id":"b03eee68-ca5f-4b3c-b98d-fd6922740e5b","year":2025},"citing_paper":{"arxiv_id":"2606.26935","last_updated":"2026-06-25T12:09:16Z","snapshot_observed_at":"2026-08-15T13:09:42.629399Z","submitted_at":"2026-06-25T12:09:16Z","title":"Where Do CoT Training Gains Land in LLM based Agents?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T04:55:14.293452Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2606.26935"},"observation_digest":"sha256:2db00320c9b34f4a28987fdeda3b41d20df6d0c0f2c9ed3e693acb2993ed6922","observation_id":"3199632a-16f2-449e-bb81-e1a2c6d87600","resolution":{"observed_at":"2026-07-04T13:49:51.498548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-07-04T13:49:51.497057Z","title":"Reasoning model unlearning: Forgetting traces, not just answers, while preserving rea- soning skills","venue":null,"work_id":"b03eee68-ca5f-4b3c-b98d-fd6922740e5b","year":2025},"citing_paper":{"arxiv_id":"2606.29984","last_updated":"2026-06-29T08:58:33Z","snapshot_observed_at":"2026-08-14T19:16:14.735577Z","submitted_at":"2026-06-29T08:58:33Z","title":"Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-30T06:12:49.839459Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2606.29984"},"observation_digest":"sha256:8d7f7f256686d089d046a532e3480659b44a193daab41ba5db22b5f5267ca3fc","observation_id":"a1e99ab0-aaf5-492f-ad01-23543337c690","resolution":{"observed_at":"2026-06-30T06:14:18.884505Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.03871","snapshot_observed_at":"2026-08-05T13:40:57.907170Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03745","last_updated":"2026-08-04T14:38:06Z","snapshot_observed_at":"2026-08-20T16:24:43.343365Z","submitted_at":"2026-08-04T14:38:06Z","title":"Risky Business: Measuring The Faithfulness-Safety Tension","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T13:40:57.907170Z"},"links":{"cited_paper":"/paper/2509.03871","citing_paper":"/paper/2608.03745"},"observation_digest":"sha256:2dca96ac10d803649595fcf0c8cb9a756d5e29eb6580a22039b624efad9b9b8e","observation_id":"4ef013ca-8e43-4489-a143-943009f877fe","resolution":{"observed_at":"2026-08-05T13:40:57.907170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.03871/citation-record","integrity":"/paper/2509.03871/integrity","json":"/paper/2509.03871/citation-record.json","paper":"/paper/2509.03871"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-21T21:53:39.790143Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-05T10:38:58.142775Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.142775Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:4de1367973d811b7e678aea533d7ead154ef5e88aaddc28185ceecdb8fe397f6","observation_id":"7d684ae2-6ab1-4786-8186-c77c6ece9bcd","resolution":{"observed_at":"2026-08-05T10:38:58.142775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17650","last_updated":"2025-05-23T09:14:48Z","snapshot_observed_at":"2026-08-15T15:57:20.602338Z","submitted_at":"2025-05-23T09:14:48Z","title":"Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17650","snapshot_observed_at":"2026-08-05T10:38:58.228860Z","title":"Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking? arXiv preprint arXiv:2505.17650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.228860Z"},"links":{"cited_paper":"/paper/2505.17650","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:91a7259a0cef792548d15117bb7780ae34ba0e081c9cf7f9572fba66fa996057","observation_id":"d17092a0-1d6f-47c6-a1fa-d05acfb57e6b","resolution":{"observed_at":"2026-08-05T10:38:58.228860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15092","last_updated":"2025-03-19T10:44:37Z","snapshot_observed_at":"2026-08-22T04:59:07.749334Z","submitted_at":"2025-03-19T10:44:37Z","title":"Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15092","snapshot_observed_at":"2026-08-05T10:38:58.311706Z","title":"Towards understanding the safety boundaries of deepseek models: Evaluation and findings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.311706Z"},"links":{"cited_paper":"/paper/2503.15092","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:39e7aae3cefdb2048b7f2f79601c1e9982b5c1967c6015b9e028e025e4c2415c","observation_id":"2ae816db-1f4e-48cd-a66a-b5bc49ffa739","resolution":{"observed_at":"2026-08-05T10:38:58.311706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-08-17T21:55:02.668814Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15585","snapshot_observed_at":"2026-08-05T10:38:58.402887Z","title":"A comprehensive survey in llm (-agent) full stack safety: Data, training and deployment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.402887Z"},"links":{"cited_paper":"/paper/2504.15585","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:6bbaa1addfdbba91ffff3e3d1f62317557f08ddc5e7312bbcef3065023877fb7","observation_id":"8360dd42-bfa8-4b80-8ac4-5808aa6baa3c","resolution":{"observed_at":"2026-08-05T10:38:58.402887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:58.485426Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.485426Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:7d467839a7a5947eb17446c71a4e1681ec0397033d40fe629253578f2506476a","observation_id":"2be066f5-ef87-4f50-b954-115819e36f6e","resolution":{"observed_at":"2026-08-05T10:38:58.485426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17686","last_updated":"2024-12-23T16:11:27Z","snapshot_observed_at":"2026-08-13T21:57:18.514742Z","submitted_at":"2024-12-23T16:11:27Z","title":"Large Language Model Safety: A Holistic Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17686","snapshot_observed_at":"2026-08-05T10:38:58.561446Z","title":"Large language model safety: A holistic survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.561446Z"},"links":{"cited_paper":"/paper/2412.17686","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:05fea2e3ad1a4bf8f1daa30a79e640484c38d9fc87a03d10c3f09b1c26fa33fa","observation_id":"c254488c-c2f7-46ee-beaf-88b8bd574a9e","resolution":{"observed_at":"2026-08-05T10:38:58.561446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-05T10:38:58.646795Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.646795Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:aa2e462e255ca3725cfd1788efbf0677257d0369ef93663de93f3adbc22aff57","observation_id":"e2c15ced-bc72-40a5-a4bc-5d5456d2d60b","resolution":{"observed_at":"2026-08-05T10:38:58.646795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-05T10:38:58.714356Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.714356Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:f5d32119b46210b360bb8b8a721b42584598d7605f4a8cce8a1cc6da135640ab","observation_id":"934e544c-2bb9-4c60-bb5f-57e5d2618c37","resolution":{"observed_at":"2026-08-05T10:38:58.714356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:58.806352Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.806352Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:5674a742f0d1e6c829be54b99e0fbe3e64a5cc82e0a9efa930dfc6fa94a8e70f","observation_id":"b26d5bf3-a448-4ae3-a547-ec663a5f02c0","resolution":{"observed_at":"2026-08-05T10:38:58.806352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-05T10:38:58.871065Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.871065Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:19e034b770e9573017f9281b5cb2add003774805a66a54ca919b04627c75b3a3","observation_id":"170bab49-91d8-4810-8e0d-9438cdcd2257","resolution":{"observed_at":"2026-08-05T10:38:58.871065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:58.960029Z","title":"Efficient reasoning models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:58.960029Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8b677a80bb418ea44416030fb8871a64bdce5a7fdc05fd7057714f851b6b01dc","observation_id":"610366fc-8b1b-4b47-a96a-2bbf9621125a","resolution":{"observed_at":"2026-08-05T10:38:58.960029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:59.035605Z","title":"Safety Reasoning with Guidelines","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.035605Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8e08312ade9a27b72925f85e6521338e2ad4184cf577534101bb3867fc886974","observation_id":"d9ea0c3d-8c8a-41f9-9473-58e19b5eb048","resolution":{"observed_at":"2026-08-05T10:38:59.035605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T10:38:59.115959Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.115959Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:ae3746de3a19a804a56b8da40b4fd715abc1f88260888d0e4ce9a602eb162b9e","observation_id":"0914dd50-21dd-4180-8a74-a233e801d714","resolution":{"observed_at":"2026-08-05T10:38:59.115959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:59.182083Z","title":"The Claude 3 Model Family: Opus, Sonnet, Haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.182083Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:a2814b8280d42ec4edac11fb9c772b1a0be0a78d42761cd76dae35d1adf1e562","observation_id":"f79476f6-7db3-4486-9aad-0a71a211d833","resolution":{"observed_at":"2026-08-05T10:38:59.182083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T10:38:59.242813Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.242813Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:f277711b837ed6765024b983ae4fa2f005f85627a9c22f809c69a22abb48bac5","observation_id":"5bd43721-3fdd-45b1-ac90-cd091f384b50","resolution":{"observed_at":"2026-08-05T10:38:59.242813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:59.344978Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.344978Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8444dcbd5a3e4bc9c660ad8afd5797a10b013888ed1290b542f01a4e49faf10f","observation_id":"c7e80236-c9dd-4894-8307-84af749380bc","resolution":{"observed_at":"2026-08-05T10:38:59.344978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:59.419222Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.419222Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:998fe105dda55d19dd8e41135d5cdef97ba2868774b316432197ecd7149588dd","observation_id":"68fd7f7e-d527-4b46-8a6d-c03af03e61be","resolution":{"observed_at":"2026-08-05T10:38:59.419222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:59.510055Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.510055Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:fc77da98fccdb00e8d4b092a63770fe2b52e7ed10299435c029a4aa4980c91f0","observation_id":"6a301d2b-b3d1-4553-8f3e-5faf5958662f","resolution":{"observed_at":"2026-08-05T10:38:59.510055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:38:59.584929Z","title":"Chain-of-scrutiny: Detecting backdoor attacks for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.584929Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:f22389fa8f46b00030b7ae02b5ca7152eb82d9e3ec5e528bda61f13774601e36","observation_id":"d49a3beb-5b65-472a-83fe-2c298996ec15","resolution":{"observed_at":"2026-08-05T10:38:59.584929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T10:38:59.680716Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.680716Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:c1a6aa013fd653fa276eef05a2b2eb9e5ba39cd58080316f639a9dddea6c209b","observation_id":"cb86ee6d-174b-49a4-a54f-8791fafab37c","resolution":{"observed_at":"2026-08-05T10:38:59.680716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-16T13:09:59.425817Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-05T10:38:59.785250Z","title":"Openr: An open source framework for advanced reasoning with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.785250Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:1aef80539cf0522a73d3c830d417dcc37b34491aeb680a7a9ede1777f304d365","observation_id":"8d44e522-bf83-45c4-9b9f-51c8f7fd725c","resolution":{"observed_at":"2026-08-05T10:38:59.785250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-08-17T14:27:29.437009Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-05T10:38:59.862669Z","title":"O1 Replication Journey: A Strategic Progress Report–Part 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.862669Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:550357e0814749ee2b88cc3491ef9c5ae751a129134d78c092175840d509d746","observation_id":"54025218-799b-439d-b3b8-6be341fb747c","resolution":{"observed_at":"2026-08-05T10:38:59.862669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-08-21T00:33:19.968625Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-05T10:38:59.955343Z","title":"O1 Replication Journey–Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson? arXiv preprint arXiv:2411.16489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:59.955343Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8a123a17cdcbebdaf32102c97f9e781c8d65a68f07e470f90e0bee4ffeff959c","observation_id":"24ce318b-8b3f-498d-af59-d535234a24c3","resolution":{"observed_at":"2026-08-05T10:38:59.955343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06458","last_updated":"2025-01-11T07:10:23Z","snapshot_observed_at":"2026-08-16T12:59:12.679844Z","submitted_at":"2025-01-11T07:10:23Z","title":"O1 Replication Journey -- Part 3: Inference-time Scaling for Medical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06458","snapshot_observed_at":"2026-08-05T10:39:00.021034Z","title":"O1 Replication Journey–Part 3: Inference-time Scaling for Medical Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.021034Z"},"links":{"cited_paper":"/paper/2501.06458","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:cfd6e29a451b75fbf8d189d7a8fb664160eea20c0f1e5f06e58237dbfd49ee8a","observation_id":"4c18fd69-1946-4384-aee6-64b2651c3071","resolution":{"observed_at":"2026-08-05T10:39:00.021034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-19T23:32:03.554343Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-05T10:39:00.088338Z","title":"Llama-berry: Pairwise optimization for o1-like olympiad-level mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.088338Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:78f2698ba61798e8d2b909de8d1f2da2f85f81d3b80fb3977fb5d86852157470","observation_id":"f2bd868a-d220-45f5-ab20-d92fb7837cc5","resolution":{"observed_at":"2026-08-05T10:39:00.088338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:00.151852Z","title":"A survey of monte carlo tree search methods","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.151852Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:c87f094e8f6ee1309ea08ae303644af214b0f01e0d40ad6d08bbc46b6efea384","observation_id":"6732203c-4bca-45ba-af03-c40b798a731c","resolution":{"observed_at":"2026-08-05T10:39:00.151852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T10:39:00.239660Z","title":"Training Verifiers to Solve Math Word Problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.239660Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:728afa68af31a3ea9a444029a51e3fb91b4871243efe90ba6dd857ac1848a618","observation_id":"9811b662-a57b-4ef7-9c3b-ec3c8655bd16","resolution":{"observed_at":"2026-08-05T10:39:00.239660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:00.328322Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.328322Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:ff6bc5d1690a257565bd2e2f1408331aeca6998fdbafe98de4d2ee6e053443da","observation_id":"631cfcfb-ec8a-4b8a-9621-df358ffbb683","resolution":{"observed_at":"2026-08-05T10:39:00.328322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:00.404102Z","title":"MARIO: MAth Reasoning with code Interpreter Output–A Reproducible Pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.404102Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:2a65725f60956c01579bd8a9e9fc5ce2249e4b0ac7f06312c63b0f2f3e0cd1ef","observation_id":"b3396605-0c22-44c6-9873-37eb238d2acf","resolution":{"observed_at":"2026-08-05T10:39:00.404102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:00.496497Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.496497Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:a7316524c1592db286427a4365fbde12b77efe030e4fb27def3cd6872a392c1f","observation_id":"e4b98ad7-d3b4-404e-a961-4c5e6a7565a3","resolution":{"observed_at":"2026-08-05T10:39:00.496497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T10:39:00.582402Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.582402Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:a392d93ba906787888f15dacc34ebb63c922d4dab3130da576e3cc3e5fb95f4a","observation_id":"dd470b81-3047-4507-a0f5-029c2442a9f9","resolution":{"observed_at":"2026-08-05T10:39:00.582402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T10:39:00.647941Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.647941Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:21d6ec77380065a454c080a42b2b116db9870c1ef961c6c9adb0df2df54cc4db","observation_id":"c25a6645-d1df-4227-8f54-377d6ead8131","resolution":{"observed_at":"2026-08-05T10:39:00.647941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-08-15T00:53:48.099058Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-05T10:39:00.744945Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.744945Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:46b8de101f2598a294e2e230a09ffa1a0a805bae071fe50ecd04ef119573c3ef","observation_id":"19afe0dc-4eeb-40c5-9c4e-731a3a6d08c3","resolution":{"observed_at":"2026-08-05T10:39:00.744945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:00.819156Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.819156Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:487d5c94222390fd409609a00cbb24507f613db36c7c27c63d961860c4ae25bb","observation_id":"fefff651-33ef-465c-95da-8d89f584b8f0","resolution":{"observed_at":"2026-08-05T10:39:00.819156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T10:39:00.885552Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.885552Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:efede426d58fec3819bfce9ed06b2961cfa7cca46528bd33bb5c834562059055","observation_id":"c05d5f40-b122-4a55-9c32-ebb112432f60","resolution":{"observed_at":"2026-08-05T10:39:00.885552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:00.981498Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:00.981498Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:9d0c67e0102c5492d3b16434ebc74dbf976b83493e389d9e2ccf72041ce9f97a","observation_id":"513f4a01-cbad-4bf3-a7cb-652a27b05a98","resolution":{"observed_at":"2026-08-05T10:39:00.981498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:01.040517Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.040517Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:1b12870b2cada846bf8e14e55fe5652c352b4b6d38f177d16d4aaec21acc81f4","observation_id":"1f04f7e6-5f31-4fde-82e8-4e23f68166ea","resolution":{"observed_at":"2026-08-05T10:39:01.040517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T10:39:01.109679Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.109679Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:80f08b66f4347591ebe7e3aea7582b06dac3d97239e3bcd2459a5ba9927d9372","observation_id":"5aa71491-3a98-4766-bfa4-479123a9a6b0","resolution":{"observed_at":"2026-08-05T10:39:01.109679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:01.199920Z","title":"Star: Self-taught reasoner bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.199920Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:0763e9070a45982158cf96ba1bf3793af68bd0f30709142464b446597a2089fd","observation_id":"57befc21-8b38-4b9b-af18-ca9b8ff88b48","resolution":{"observed_at":"2026-08-05T10:39:01.199920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:01.252139Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.252139Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:5e07aacda4443a63978e1adb6404cdd876a12ffc423e97f6d359632deecb0686","observation_id":"d64622b8-f447-4ee9-b1de-0bc8c97a6ea1","resolution":{"observed_at":"2026-08-05T10:39:01.252139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T10:39:01.338262Z","title":"T \\\" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.338262Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:f40d64e18aa16f9eced476c58cd93f4adb5cd47318788425241369d2e3dc9b13","observation_id":"e487db32-9fc0-4e2f-95d8-555ccdea0028","resolution":{"observed_at":"2026-08-05T10:39:01.338262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:01.417577Z","title":"Reinforcement Learning with Verifiable Rewards: GRPO’s Effective Loss, Dynamics, and Success Amplifi- cation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.417577Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:e77afc31a0314d2855e9c4117e1e19c7b829d4578a73218b6859c8e5de460037","observation_id":"fafe2158-ea6e-4f58-b8e3-22c6740d5d33","resolution":{"observed_at":"2026-08-05T10:39:01.417577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-21T05:30:31.348509Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-05T10:39:01.493981Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.493981Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:e9075bf9fefdf4f1ee97c7bf7a281bacaaddb78358d459ddebc322e63c0ce1cc","observation_id":"194346aa-9f27-42e6-b08f-ae432e5de4b5","resolution":{"observed_at":"2026-08-05T10:39:01.493981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-05T10:39:01.576595Z","title":"Multimodal chain-of- thought reasoning: A comprehensive survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.576595Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:e04201123f4a94ce26f275c72c84c085bac20dd38d46238b3fe8b7a908b99985","observation_id":"6d121e73-d805-4eef-a774-ff999f4b0b1d","resolution":{"observed_at":"2026-08-05T10:39:01.576595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:01.651618Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.651618Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:d39e05326d3c3963e3751249f924e3c8d628cfdfbd4240798b800a2dee6804a8","observation_id":"d24712ef-2e8f-464e-9776-4b8359319493","resolution":{"observed_at":"2026-08-05T10:39:01.651618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:01.740213Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.740213Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:22bbf82b5c5a206c839b2b1c24205b57a75fd5e495f2df73a387361469d6bc18","observation_id":"cbe95329-852b-4cec-bd1e-6ea494c9cff8","resolution":{"observed_at":"2026-08-05T10:39:01.740213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12591","last_updated":"2024-11-15T21:01:37Z","snapshot_observed_at":"2026-08-18T06:12:16.918583Z","submitted_at":"2024-11-15T21:01:37Z","title":"Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12591","snapshot_observed_at":"2026-08-05T10:39:01.812797Z","title":"Thinking before looking: Improving multimodal llm reasoning via mitigating visual hallucination","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.812797Z"},"links":{"cited_paper":"/paper/2411.12591","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:288cb3b6429dab1e61f025b172988863c0c464e11ce70a6cecff36e71e3fa155","observation_id":"140f773a-c2e3-468a-b8c4-9dc3f4a975b4","resolution":{"observed_at":"2026-08-05T10:39:01.812797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-05T10:39:01.904314Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.904314Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:2bec51265b29c4a0ab8507555ee26999c975d4fd675933dcd849a57745668d8f","observation_id":"5d8e403c-73af-42f9-8e7c-e3fe17d32bd8","resolution":{"observed_at":"2026-08-05T10:39:01.904314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-16T12:59:16.590181Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-05T10:39:02.002966Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.002966Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8440456e5ae1735408396412c73525150fb358766e3d80d86265ef114e728f9c","observation_id":"85c804ad-0e2b-49a0-b4a0-5a494adfda72","resolution":{"observed_at":"2026-08-05T10:39:02.002966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-15T17:15:16.352032Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-05T10:39:02.106102Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems? arXiv preprint arXiv:2501.11284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.106102Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:a3ef001e1b2e2c36d22a067dda5ef95fad39388febcf50f4257ff44952aba497","observation_id":"383c04bc-624c-4b91-a06b-d9a1253be304","resolution":{"observed_at":"2026-08-05T10:39:02.106102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-15T19:40:30.225099Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-05T10:39:02.195906Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.195906Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:9bdcc995196e2389903def4db9cd3a7403a29c2dfe5f2727f9be896788dadd93","observation_id":"22b6c7f7-abb2-4156-85da-64c777a29856","resolution":{"observed_at":"2026-08-05T10:39:02.195906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-16T13:07:19.184083Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-05T10:39:02.269696Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.269696Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:01de670a65101ecc1459e3350c14da1d50b56241df52ba6cac63e1407c054e13","observation_id":"67f349f2-fb93-440c-b0d2-ac3572e510f8","resolution":{"observed_at":"2026-08-05T10:39:02.269696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:02.347544Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.347544Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:d05e6ae97a06037cabad48d6b808a5663960e278a4d7d79395224097f1f3821d","observation_id":"51e2896e-645a-4700-adc9-049ae7917dff","resolution":{"observed_at":"2026-08-05T10:39:02.347544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-19T12:24:01.366896Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-05T10:39:02.399950Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.399950Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8a649a2321a831e8b0789c49775f27e2111a1d9ff279b8ddd33e430540043bd0","observation_id":"b685855f-c7de-430b-a29e-3eb89d776736","resolution":{"observed_at":"2026-08-05T10:39:02.399950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13383","last_updated":"2025-02-19T02:46:52Z","snapshot_observed_at":"2026-08-16T12:57:08.304295Z","submitted_at":"2025-02-19T02:46:52Z","title":"MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13383","snapshot_observed_at":"2026-08-05T10:39:02.499587Z","title":"Mm-verify: Enhancing multimodal reasoning with chain-of-thought verification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.499587Z"},"links":{"cited_paper":"/paper/2502.13383","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:fc084b8706452ab0ec94a3a628723f382ecf6d3f3d5bb34aa415984e78fb172b","observation_id":"2748fbf2-ba15-4b40-92e5-fafea5ad881d","resolution":{"observed_at":"2026-08-05T10:39:02.499587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01306","last_updated":"2025-01-03T08:29:37Z","snapshot_observed_at":"2026-08-14T19:11:08.554167Z","submitted_at":"2025-01-02T15:36:50Z","title":"Think More, Hallucinate Less: Mitigating Hallucinations via Dual Process of Fast and Slow Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01306","snapshot_observed_at":"2026-08-05T10:39:02.581234Z","title":"Think More, Hallucinate Less: Mitigating Hallucinations via Dual Process of Fast and Slow Thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.581234Z"},"links":{"cited_paper":"/paper/2501.01306","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:dfa92eb9733ea2324902d49715afa7682b5dbac7ba86c2b660406e3894626087","observation_id":"4d1ef5d2-b76f-44ec-a949-dd3d6e8c89ba","resolution":{"observed_at":"2026-08-05T10:39:02.581234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:02.666630Z","title":"HalluMeasure: Fine-grained hallucination measurement using chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.666630Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:5ca212407dea6e7b829236dfce86ca88f8ae19204abf8b3c8829a57aa62572fc","observation_id":"a383f797-e3bd-4b2b-bfb0-72f46d5084d5","resolution":{"observed_at":"2026-08-05T10:39:02.666630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05243","last_updated":"2025-06-05T17:02:52Z","snapshot_observed_at":"2026-08-20T06:25:43.344643Z","submitted_at":"2025-06-05T17:02:52Z","title":"CLATTER: Comprehensive Entailment Reasoning for Hallucination Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05243","snapshot_observed_at":"2026-08-05T10:39:02.718004Z","title":"CLATTER: Comprehensive Entailment Reasoning for Hallucination Detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.718004Z"},"links":{"cited_paper":"/paper/2506.05243","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:b42cf11e24a2d21739fe537a02b656e22bcb884ec1cd7eb5d73c7c02fc84259b","observation_id":"0254abf4-680a-4735-85bc-717af5572cbd","resolution":{"observed_at":"2026-08-05T10:39:02.718004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05093","last_updated":"2025-05-12T01:30:34Z","snapshot_observed_at":"2026-08-16T13:27:26.567680Z","submitted_at":"2024-08-09T14:34:32Z","title":"Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05093","snapshot_observed_at":"2026-08-05T10:39:02.811140Z","title":"Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language- Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.811140Z"},"links":{"cited_paper":"/paper/2408.05093","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:5c389da6bd1e42df573f396a024cac56e4c4b71fd14353dcfb831025b12c28c6","observation_id":"679fcc8f-0ad7-47aa-ab15-37384e54570d","resolution":{"observed_at":"2026-08-05T10:39:02.811140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-16T12:49:29.988082Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T10:39:02.881423Z","title":"Grounded chain-of- thought for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.881423Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:0b7de5404e68bbaf05f465f679b89bc851bc64a6b1c340de3a6646c6d28e0d17","observation_id":"51891bc4-500e-4224-9a61-e537c1f404e1","resolution":{"observed_at":"2026-08-05T10:39:02.881423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:02.968136Z","title":"CoMT: Chain-of- Medical-Thought Reduces Hallucination in Medical Report Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.968136Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:ad319b220436972230e5b7c1ee83fee43b5e4ec790aa5a28d68098a6a731654d","observation_id":"3b7cb315-8224-44e6-b02d-f9c0e3e8ec5e","resolution":{"observed_at":"2026-08-05T10:39:02.968136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24238","last_updated":"2025-06-02T04:16:04Z","snapshot_observed_at":"2026-08-17T05:22:52.210760Z","submitted_at":"2025-05-30T05:54:36Z","title":"MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24238","snapshot_observed_at":"2026-08-05T10:39:03.028373Z","title":"MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.028373Z"},"links":{"cited_paper":"/paper/2505.24238","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:bcb0a91ce799688cca185a46286e0a1c83d35baa864249ec028ab49ca9bb50f6","observation_id":"8f61cce6-5c2d-4d17-8b3f-2c8cc3ad9045","resolution":{"observed_at":"2026-08-05T10:39:03.028373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-18T17:17:03.017013Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-08-05T10:39:03.113610Z","title":"The Hallucination Tax of Reinforcement Finetuning.arXiv preprint arXiv:2505.13988, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.113610Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:6f09be1eba562d08568ecaf189f8c1621039bc70c61ede59e8e3a90c066d7697","observation_id":"d1ed60c3-31ad-4d33-8b55-7c3267e55276","resolution":{"observed_at":"2026-08-05T10:39:03.113610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21523","last_updated":"2025-06-20T08:41:41Z","snapshot_observed_at":"2026-08-21T04:36:23.436302Z","submitted_at":"2025-05-23T05:08:40Z","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21523","snapshot_observed_at":"2026-08-05T10:39:03.190809Z","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.190809Z"},"links":{"cited_paper":"/paper/2505.21523","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:1b05af5868643cb59bc8aa8ef5142377371de11eb3c320f192ba2f7d4091d80b","observation_id":"aec353aa-b126-4c32-a2ad-2a8376ce7f35","resolution":{"observed_at":"2026-08-05T10:39:03.190809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-20T06:05:04.363087Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23646","snapshot_observed_at":"2026-08-05T10:39:03.278036Z","title":"Are Reasoning Models More Prone to Hallucination? arXiv preprint arXiv:2505.23646, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.278036Z"},"links":{"cited_paper":"/paper/2505.23646","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:70bc9c355c87db95d0ed38102cb141c34a1e3bd0344318eb9f39491592413dcf","observation_id":"b0fcb64b-11b0-4b10-b200-be3b69dc526a","resolution":{"observed_at":"2026-08-05T10:39:03.278036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-08-17T17:31:40.958159Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09038","snapshot_observed_at":"2026-08-05T10:39:03.364570Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.364570Z"},"links":{"cited_paper":"/paper/2506.09038","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:0fdab4e3a024e896ce0c6bb1b637df17da857d613cb783ace4596a2193415bfa","observation_id":"069a4431-2cd7-4e46-9e11-26cf1ab698aa","resolution":{"observed_at":"2026-08-05T10:39:03.364570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:03.438085Z","title":"Auditing Meta-Cognitive Hallucinations in Reasoning Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.438085Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:45b0b5553ea2c57caf476b32b4c8975bcb241fa7e66470ff0e4be7255e590c9e","observation_id":"600848f0-cea2-479a-a9dd-11a0545b5a32","resolution":{"observed_at":"2026-08-05T10:39:03.438085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:03.522217Z","title":"The Hallucination Dilemma: Factuality-Aware Reinforcement Learning for Large Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.522217Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:edc8b5f3f8df88fb0a3d71141658ab8d4243771cb5cb8fbb28130b5b0976fd06","observation_id":"1717b948-8b70-4e97-ae2c-efaf562f2d89","resolution":{"observed_at":"2026-08-05T10:39:03.522217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:03.602018Z","title":"Analyzing Logical Fallacies in Large Language Models: A Study on Hallucination in Mathematical Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.602018Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:e7f00c32acd9c165810c178d4307f9edce528ee057f1e26c8743f9ea3a06066c","observation_id":"fd1a26e2-50c8-46a3-89b6-67a1680db91f","resolution":{"observed_at":"2026-08-05T10:39:03.602018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12886","last_updated":"2025-05-19T09:16:40Z","snapshot_observed_at":"2026-08-15T20:22:03.928200Z","submitted_at":"2025-05-19T09:16:40Z","title":"Detection and Mitigation of Hallucination in Large Reasoning Models: A Mechanistic Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12886","snapshot_observed_at":"2026-08-05T10:39:03.674536Z","title":"Detection and Mitigation of Hallucination in Large Reasoning Models: A Mechanistic Perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.674536Z"},"links":{"cited_paper":"/paper/2505.12886","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:b35926857e647cf92b3b6e60d983f56710d6baae830188216eda29b283350f8d","observation_id":"e60f5e06-b4b8-41eb-95bb-75a6fb4b37d1","resolution":{"observed_at":"2026-08-05T10:39:03.674536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:03.728877Z","title":"Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.728877Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:f496f82ef33aad3f6b6939c2c0e6a079e660f13f8f29b63d741002c20ecac70a","observation_id":"cab1ef21-b8ef-4cd2-bb63-4d76cee974f3","resolution":{"observed_at":"2026-08-05T10:39:03.728877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:03.777748Z","title":"Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.777748Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:7eb7f84df99eb08dc1fd5eeca2171e47a849ae1291b212e65c47cfecc286229e","observation_id":"36b76c94-a499-49a2-bfd9-efb6d447c250","resolution":{"observed_at":"2026-08-05T10:39:03.777748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05419","last_updated":"2025-04-07T18:42:01Z","snapshot_observed_at":"2026-08-18T08:09:06.377214Z","submitted_at":"2025-04-07T18:42:01Z","title":"Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05419","snapshot_observed_at":"2026-08-05T10:39:03.846399Z","title":"Reasoning Models Know When They’re Right: Probing Hidden States for Self-Verification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.846399Z"},"links":{"cited_paper":"/paper/2504.05419","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:5b6cbf1ab4afb21de6c4976bfffdf729ebc91ff29c6f978902f4742dd22553c9","observation_id":"0c49d9c9-e8d3-4485-9753-cb07cd765495","resolution":{"observed_at":"2026-08-05T10:39:03.846399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:03.933007Z","title":"Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.933007Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:82f01229c8b0a25973c38516eec86f7c235d1614d63d5e0a392f9a114cca1140","observation_id":"c025b55a-1598-4e64-94b7-88672eb309d0","resolution":{"observed_at":"2026-08-05T10:39:03.933007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-08-13T18:02:27.155379Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-05T10:39:04.017581Z","title":"Measuring faithfulness in chain-of-thought reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.017581Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:3c6a39f583df43df5f321aa5ed4ef435a45acfd67c637dd7297ce9cb82660e00","observation_id":"ea3174b3-7e63-4164-af9b-2a26598b591f","resolution":{"observed_at":"2026-08-05T10:39:04.017581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.122351Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.122351Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:b7e9c25bb3d619f77766194ea09a5b0876731efe0bac725d36b75290af264eb8","observation_id":"b2dbe24d-52f7-47e1-9892-fc18aa3ff9cd","resolution":{"observed_at":"2026-08-05T10:39:04.122351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.202832Z","title":"Measuring faithfulness of chains of thought by unlearning reasoning steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.202832Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:3f1c15fc5a73b3dcd397330633f2566163b6b739c4c568410f7844eacdf19bfa","observation_id":"1b1c5bcd-3e3b-4a0e-b0fe-74cb0090ec0c","resolution":{"observed_at":"2026-08-05T10:39:04.202832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13774","snapshot_observed_at":"2026-08-05T10:39:04.273817Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.273817Z"},"links":{"cited_paper":"/paper/2505.13774","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:9315b64eee7ca5293a6824a56b99d7e16d45279df1f5de818479a6a0f7607f09","observation_id":"df660e94-2abd-4754-be99-949a2751cd90","resolution":{"observed_at":"2026-08-05T10:39:04.273817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.365681Z","title":"Chain-of-Thought Unfaithfulness as Disguised Accuracy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.365681Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:a41ba63bd077a7b11ba21d9b7c1191ccd60738208e79a3b05c82672d3a0948c4","observation_id":"8f379e7e-4881-4ecd-bdfe-858513bb4c92","resolution":{"observed_at":"2026-08-05T10:39:04.365681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-16T12:51:00.810519Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-05T10:39:04.414376Z","title":"Chain-of- thought reasoning in the wild is not always faithful","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.414376Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:31d8ec84f5bd703b32b2ee9bdb49705cd7c745e3ccc446635adef12f40b44ae3","observation_id":"2dd18d34-1be3-434d-8793-e115c674b165","resolution":{"observed_at":"2026-08-05T10:39:04.414376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.465800Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful? In ICLR 2025 Workshop on Foundation Models in the Wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.465800Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:2c754158f8029ed8f286a8d89c0dc8f5146d0a55262a06aa9754910d161f51a6","observation_id":"8fe62b89-f21d-4614-96a3-6c8c9b36cc8f","resolution":{"observed_at":"2026-08-05T10:39:04.465800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.520817Z","title":"Reasoning Models Don’t Always Say What They Think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.520817Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:28ad6dc8a9b9cb5b4d599ac4c78403b028a159a2bfcce44a7831b5cef07db25d","observation_id":"bdf6b7b3-ba69-480a-afc1-3816552f5932","resolution":{"observed_at":"2026-08-05T10:39:04.520817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18915","last_updated":"2025-05-31T11:18:02Z","snapshot_observed_at":"2026-08-16T13:48:16.440401Z","submitted_at":"2024-05-29T09:17:46Z","title":"Towards Better Chain-of-Thought: A Reflection on Effectiveness and Faithfulness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18915","snapshot_observed_at":"2026-08-05T10:39:04.568023Z","title":"Towards faithful chain-of-thought: Large language models are bridging reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.568023Z"},"links":{"cited_paper":"/paper/2405.18915","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:eeee2381b3dc2760f4fd8d2bf8331794b25bbd4f087a64609bcfa98f0f7b4055","observation_id":"349ac01d-492b-4973-b758-b9a865f9f38b","resolution":{"observed_at":"2026-08-05T10:39:04.568023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04614","last_updated":"2024-03-14T03:48:08Z","snapshot_observed_at":"2026-08-19T06:09:11.502729Z","submitted_at":"2024-02-07T06:32:50Z","title":"Faithfulness vs. Plausibility: On the (Un)Reliability of Explanations from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04614","snapshot_observed_at":"2026-08-05T10:39:04.627878Z","title":"Faithfulness vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.627878Z"},"links":{"cited_paper":"/paper/2402.04614","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:795dc1c28e9cc4dfae43a3e7fc5468810f9ad9ff9e60bdb9844579ac11217bb7","observation_id":"3f73ef14-9207-4f9d-bf08-4e403d033815","resolution":{"observed_at":"2026-08-05T10:39:04.627878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.683690Z","title":"How Likely Do LLMs with CoT Mimic Human Reasoning? In Proc","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.683690Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:74e6ded23dd8763d99299ab37db82a8f6bd77f55df5208e263b6ac7967563974","observation_id":"bc2adb70-ea5d-451b-8821-ec6633379986","resolution":{"observed_at":"2026-08-05T10:39:04.683690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.736151Z","title":"On the difficulty of faithful chain-of-thought reasoning in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.736151Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:7c30d5156933a9806d17386210fdd7573fcd481688bb275c8b50ddcd5bfc57a7","observation_id":"f1b318b7-55c1-473d-b04d-b1a9add6b090","resolution":{"observed_at":"2026-08-05T10:39:04.736151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.787173Z","title":"On the impact of fine-tuning on chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.787173Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:0f43eba02fe4519f23d67bf37fa373c0fcd4003ecebb49cbc7d19b1af7b1fee2","observation_id":"f9e417f7-0f61-4660-a805-f917c0d1acf1","resolution":{"observed_at":"2026-08-05T10:39:04.787173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.834930Z","title":"Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.834930Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:318586dc4e81b044ab1b40b9bf7f260566fd2468d6c4463b70efa5fa5bfd1979","observation_id":"833bd429-3cfe-479f-a311-5cdf9586a51a","resolution":{"observed_at":"2026-08-05T10:39:04.834930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:04.920168Z","title":"Faithful logical reasoning via symbolic chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.920168Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:ae792018ba34bdae0adf29424abbc218bab369ee83cfd5e28dd0f1ec089feb69","observation_id":"80c8271e-838c-43a1-a83b-a94817eb97a6","resolution":{"observed_at":"2026-08-05T10:39:04.920168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11768","last_updated":"2023-07-25T04:01:43Z","snapshot_observed_at":"2026-08-16T15:15:50.660671Z","submitted_at":"2023-07-17T00:54:10Z","title":"Question Decomposition Improves the Faithfulness of Model-Generated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11768","snapshot_observed_at":"2026-08-05T10:39:04.996814Z","title":"Question decomposition improves the faithfulness of model-generated reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.996814Z"},"links":{"cited_paper":"/paper/2307.11768","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:2f457dbc7dc6dba11e51a7f537686ab0f4dd4e724f1eaa7dc4fabe62dc702eae","observation_id":"b34a989e-e8b8-460a-b41d-e1f0273933fc","resolution":{"observed_at":"2026-08-05T10:39:04.996814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.049781Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.049781Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:e5345c71ca60872c7f01c6893e32610abd5ad38220a24f7096001943513ac1a8","observation_id":"7eb7d797-5283-4e3c-b0bc-2597c266defe","resolution":{"observed_at":"2026-08-05T10:39:05.049781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.118378Z","title":"Logic-LM: Empowering Large Language Models with Symbolic Solvers for Faithful Logical Reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.118378Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:38a55fbf23f6d88cd0f7f753ab5d4e70d1ff41931b4ca9a4e8b1190fdd2527a2","observation_id":"36edc327-6624-444e-9786-0bce5bdc0433","resolution":{"observed_at":"2026-08-05T10:39:05.118378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.186460Z","title":"FLARE: Faithful Logic-Aided Reasoning and Exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.186460Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:3eb331dd83e4eec516729e6bd11cfbb6ee752b2be16f6001958d19d3e2c06067","observation_id":"fe67efb8-5a17-4ce7-bdc6-1cdef025df79","resolution":{"observed_at":"2026-08-05T10:39:05.186460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.189613Z","title":"CoMAT: Chain of mathematically annotated thought improves mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.189613Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:c6bfde1b6121620720596ff48e1e9b34b217ce7189d8ead51c478f452e6266ea","observation_id":"bf457c86-83c9-4be5-b4eb-0d1c3fa4e3d5","resolution":{"observed_at":"2026-08-05T10:39:05.189613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.267606Z","title":"Causal-driven Large Language Models with Faithful Reasoning for Knowledge Question Answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.267606Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:2b93777d7b619ece1df9383711ce84becad715603c90a22f512fd0eb310a114c","observation_id":"ff9a1246-84ea-4b1f-ba08-851c3bfa4e01","resolution":{"observed_at":"2026-08-05T10:39:05.267606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.365746Z","title":"Fact: Teaching mllms with faithful, concise and transferable rationales","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.365746Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:e6e2565a9c5759fe34f4c98552a23c0db533c2bcc57dd12b3cb4e4876a92bfbc","observation_id":"77f4e3bc-0fbc-487f-ba06-bafe7f586ae8","resolution":{"observed_at":"2026-08-05T10:39:05.365746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.468396Z","title":"Markovian Transformers for Informative Language Modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.468396Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:c4e881df9db29c6058bb056f997cb7216db01906eeffd972e30679a55f465767","observation_id":"edf8e7fb-fd5c-4290-bbcc-c0382816e13b","resolution":{"observed_at":"2026-08-05T10:39:05.468396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16529","last_updated":"2025-05-16T13:29:19Z","snapshot_observed_at":"2026-08-19T09:40:23.227129Z","submitted_at":"2025-03-18T08:38:10Z","title":"Safety Evaluation and Enhancement of DeepSeek Models in Chinese Contexts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16529","snapshot_observed_at":"2026-08-05T10:39:05.612352Z","title":"Safety Evaluation and Enhancement of DeepSeek Models in Chinese Contexts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.612352Z"},"links":{"cited_paper":"/paper/2503.16529","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:7602bc6c56851e4e1d2e263d9fb87a96b119962d602ff5596abecad8a3df249c","observation_id":"6273c2d2-6584-4c26-a111-7a8d6cce3823","resolution":{"observed_at":"2026-08-05T10:39:05.612352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10192","last_updated":"2025-03-13T09:27:24Z","snapshot_observed_at":"2026-08-16T12:50:26.566861Z","submitted_at":"2025-03-13T09:27:24Z","title":"Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10192","snapshot_observed_at":"2026-08-05T10:39:05.730113Z","title":"Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.730113Z"},"links":{"cited_paper":"/paper/2503.10192","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:a3114e0a2b6acde279d5f6ede6315722faa3e3daf2ffdc89e5d247ee0b502fde","observation_id":"19cfad14-82b7-4d3a-a0ed-3d63e836e747","resolution":{"observed_at":"2026-08-05T10:39:05.730113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:39:05.842706Z","title":"The hidden risks of large reasoning models: A safety assessment of r1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:05.842706Z"},"links":{"citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8ce21d8dafb4918142f10bb837f8eb82e55042b8558e7b1c58855b69d3e6adf1","observation_id":"e940c272-3b52-427d-9301-24d1d299e2ec","resolution":{"observed_at":"2026-08-05T10:39:05.842706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 8 inbound Pith citation observations for arXiv:2509.03871."}