{"as_of":"2026-08-20T05:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66f9e1d16c7313f58ba6d56f11b186f6fc83aa9594f48c6ac2737ffa5a1e9086","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:03:15.426142Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T12:08:10.552789Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"cited_work":{"arxiv_id":"2507.22940","doi":"10.48550/arxiv.2507.22940","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2507.22940 , year=","venue":"ArXiv.org","work_id":"b396dd0c-f842-4d3c-a74c-02dfbdd8be52","year":2025},"citing_paper":{"arxiv_id":"2605.19228","last_updated":"2026-06-07T18:34:11Z","snapshot_observed_at":"2026-08-15T18:06:45.991971Z","submitted_at":"2026-05-19T00:57:51Z","title":"Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T06:43:23.870127Z"},"links":{"cited_paper":"/paper/2507.22940","citing_paper":"/paper/2605.19228"},"observation_digest":"sha256:12eea07402895004924bed55351d61c225829203317459146e668e4a3f787c55","observation_id":"104cf56b-0a3d-410a-88c1-2ceda34d5c0b","resolution":{"observed_at":"2026-05-20T06:48:05.981542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"cited_work":{"arxiv_id":"2507.22940","doi":"10.48550/arxiv.2507.22940","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2507.22940 , year=","venue":"ArXiv.org","work_id":"b396dd0c-f842-4d3c-a74c-02dfbdd8be52","year":2025},"citing_paper":{"arxiv_id":"2606.02258","last_updated":"2026-06-01T13:45:18Z","snapshot_observed_at":"2026-08-02T16:51:34.074966Z","submitted_at":"2026-06-01T13:45:18Z","title":"Matter to Mechanism: A Benchmark for AI Co-Scientists in Materials and Battery Research","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T12:08:10.552789Z"},"links":{"cited_paper":"/paper/2507.22940","citing_paper":"/paper/2606.02258"},"observation_digest":"sha256:3e140db915f80493aacfcb4f2800e0125e67b070a649a09b30a419115a2db99d","observation_id":"294bc273-77c1-43e4-b4c7-f686bdddfeab","resolution":{"observed_at":"2026-06-28T12:12:07.831497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22940/citation-record","integrity":"/paper/2507.22940/integrity","json":"/paper/2507.22940/citation-record.json","paper":"/paper/2507.22940"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.034973Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.034973Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:12198099dba83a1e9fe8f955cb5fcbb6a350133271e99bc8b5970d8db412b9f0","observation_id":"a15e3588-c29a-4b9e-a209-80d92dd4745d","resolution":{"observed_at":"2026-08-15T18:03:15.034973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T18:03:15.039775Z","title":"Constitutional AI: harmlessness from AI feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.039775Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:119c691dbc0974dad51f43ac9d9fe7578544936c37148cde3f39fc17befb1cec","observation_id":"a703d20e-27af-49b3-890e-7be3277f1b41","resolution":{"observed_at":"2026-08-15T18:03:15.039775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T18:03:15.045001Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.045001Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:59699525f78d29379684f2f4a6b5b01f988b9556aac09d917250caa0f049032b","observation_id":"ddd8c491-abf3-4d90-8371-5138374303c5","resolution":{"observed_at":"2026-08-15T18:03:15.045001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T18:03:15.049765Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.049765Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:f9147e5688b9c94f5da131f42b3227eb92c14aaf07f56f8a65aeb799eeb8c369","observation_id":"1281603e-5df3-4ead-8fad-1d3b24c5bf5b","resolution":{"observed_at":"2026-08-15T18:03:15.049765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.054477Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.054477Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:00e07ccb77cc0023828c0cb901ef65cd530abe1b240b81e02b511167c3a4d79c","observation_id":"0bcb41a8-d4a3-4cd1-b4bd-d24ef379f2bf","resolution":{"observed_at":"2026-08-15T18:03:15.054477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T18:03:15.059198Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.059198Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:c6db1acc47c3075d9b4552ac5ee43b02a23ea89d3af0b6268f9cfb5c11939805","observation_id":"2c7dee8c-23be-4991-b986-28beaf76540e","resolution":{"observed_at":"2026-08-15T18:03:15.059198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T18:03:15.064263Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.064263Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:b8e2b6ce3f325301f4d0f878bb4567230372dbd37cd5dfc2fe361cff7446855e","observation_id":"670d17e9-ea99-4c80-8b44-5ffbab56cb8b","resolution":{"observed_at":"2026-08-15T18:03:15.064263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.073137Z","title":"Qwq-32b: Embracing the power of reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.073137Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:576a3088377de6b9b655ed9cd622d1ee061e582dc2db555a7fbefbb92298b297","observation_id":"45787ff0-20a7-45c5-99a3-97e623309e16","resolution":{"observed_at":"2026-08-15T18:03:15.073137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.077594Z","title":"Learning to reason with llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.077594Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:d8f3d5134ebfb03d3f0a9ef9218c2738a5693b1a0fea481e986845863020266a","observation_id":"35d7ce23-942b-49c5-ae84-0aff7cbff47b","resolution":{"observed_at":"2026-08-15T18:03:15.077594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.082334Z","title":"Claude 3.7 sonnet and claude code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.082334Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:10f2e0512cc4a760669888a017142c43c390ee7989ca1a910a87c6f45dfa8ffa","observation_id":"7c8e32c1-5a10-46cd-ab4f-db81477f63e4","resolution":{"observed_at":"2026-08-15T18:03:15.082334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00097","last_updated":"2025-06-22T04:43:14Z","snapshot_observed_at":"2026-08-18T22:28:19.456428Z","submitted_at":"2024-08-27T02:06:45Z","title":"Large Language Models for Disease Diagnosis: A Scoping Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00097","snapshot_observed_at":"2026-08-15T18:03:15.086673Z","title":"Large language models for disease diagnosis: A scoping review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.086673Z"},"links":{"cited_paper":"/paper/2409.00097","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:eaa25bbffddcd9e8f019a7d03b1a518b56f86269b96c461bf132214e0bcb3273","observation_id":"f3ddf8ae-848d-484b-a1e6-3c2555323dd2","resolution":{"observed_at":"2026-08-15T18:03:15.086673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01730","last_updated":"2024-01-28T09:25:12Z","snapshot_observed_at":"2026-08-17T05:21:20.498960Z","submitted_at":"2024-01-28T09:25:12Z","title":"Evaluating LLM -- Generated Multimodal Diagnosis from Medical Images and Symptom Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01730","snapshot_observed_at":"2026-08-15T18:03:15.091368Z","title":"Evaluating LLM - generated multimodal diagnosis from medical images and symptom analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.091368Z"},"links":{"cited_paper":"/paper/2402.01730","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:00d524b30230220b5cf1a26cd7700c04fbac6940a1ee571b59f5a286b8424f7e","observation_id":"325289f8-ae28-4f7c-bacf-36aeac9ad512","resolution":{"observed_at":"2026-08-15T18:03:15.091368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17638","last_updated":"2025-02-24T20:38:17Z","snapshot_observed_at":"2026-08-17T19:28:49.396116Z","submitted_at":"2025-02-24T20:38:17Z","title":"Towards Robust Legal Reasoning: Harnessing Logical LLMs in Law","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17638","snapshot_observed_at":"2026-08-15T18:03:15.095819Z","title":"Towards robust legal reasoning: Harnessing logical llms in law,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.095819Z"},"links":{"cited_paper":"/paper/2502.17638","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:d50728754a7f5c6fa882aaead9c6991c4fa5340ce283483f7f9226091159080b","observation_id":"d2df7d58-7eb6-465e-a51a-7b607ffab679","resolution":{"observed_at":"2026-08-15T18:03:15.095819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05675","last_updated":"2025-02-08T19:49:32Z","snapshot_observed_at":"2026-08-17T19:28:50.344908Z","submitted_at":"2025-02-08T19:49:32Z","title":"Investigating the Shortcomings of LLMs in Step-by-Step Legal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05675","snapshot_observed_at":"2026-08-15T18:03:15.100738Z","title":"Investigating the shortcomings of llms in step-by-step legal reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.100738Z"},"links":{"cited_paper":"/paper/2502.05675","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:a78e5293eddbb589186c10883699db1be53785cff836e475d047a5005e02c36f","observation_id":"5504c403-47e9-4d4a-a0ca-2b3860540945","resolution":{"observed_at":"2026-08-15T18:03:15.100738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18174","last_updated":"2024-12-24T05:22:33Z","snapshot_observed_at":"2026-08-18T20:10:43.460085Z","submitted_at":"2024-12-24T05:22:33Z","title":"INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18174","snapshot_observed_at":"2026-08-15T18:03:15.105798Z","title":"INVESTORBENCH: A benchmark for financial decision-making tasks with llm-based agent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.105798Z"},"links":{"cited_paper":"/paper/2412.18174","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:7b3e879bdd63ee652f2829ebbb5d073e548a3a3b9bd65348082c9bb0eac97e5e","observation_id":"8d189ea0-b83d-4ba7-8d00-7ece3006bd71","resolution":{"observed_at":"2026-08-15T18:03:15.105798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.110881Z","title":"Finqapt: Empowering financial decisions with end-to-end llm-driven question answering pipeline,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.110881Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:5e063b8abb9ce645046d6a400903ca415bd73e785653986b3c7620688a96d06b","observation_id":"7006b9f1-b8a9-4c53-83a3-6dd0ff2fdb86","resolution":{"observed_at":"2026-08-15T18:03:15.110881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05093","last_updated":"2025-05-12T01:30:34Z","snapshot_observed_at":"2026-08-16T13:27:26.567680Z","submitted_at":"2024-08-09T14:34:32Z","title":"Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05093","snapshot_observed_at":"2026-08-15T18:03:15.115336Z","title":"Order matters in hallucination: Reasoning order as benchmark and reflexive prompting for large-language-models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.115336Z"},"links":{"cited_paper":"/paper/2408.05093","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:43e8bcabe16ba0b7d8fd13141880a2da7a12de95a0b42da05f0db0874d1323a9","observation_id":"c604c2ed-a02e-4b43-9574-7c5cdbdb4d51","resolution":{"observed_at":"2026-08-15T18:03:15.115336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.120245Z","title":"CMMLU: measuring massive multitask language understanding in chinese,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.120245Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:7dc295cfd070e44440379e80ca87c9bb7673eb2bd61a856f9de256da63ce7f94","observation_id":"b2deed91-ab7e-489b-93ba-505d2a67a9f3","resolution":{"observed_at":"2026-08-15T18:03:15.120245Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.124874Z","title":"Truthfulqa: Measuring how models mimic human falsehoods,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.124874Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:6d7300e6baa17944e27a98f4f5452aed614d1c14aec0e59151027b1dfa7071f6","observation_id":"737419bd-99e6-401f-956e-3993d1de2778","resolution":{"observed_at":"2026-08-15T18:03:15.124874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.767924Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models,","venue":null,"work_id":"1d6fa40c-6aca-4685-9e6b-0503cecc1b37","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.129559Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:5daf680dff5083f10f474ac1e4ad277d37f691ecc9ebd2712a629242e3290411","observation_id":"eba5314c-e4e5-4c89-be09-c2bc3b52ce52","resolution":{"observed_at":"2026-08-15T18:03:16.772475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.753498Z","title":"Factuality enhanced language models for open-ended text generation,","venue":null,"work_id":"48f76604-5327-407f-bbff-078d53c352bf","year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.134215Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:47a7d5937ed559fdecb23cd0d14f29626eea4cff80f5dd88b8d276e93892100e","observation_id":"ac486191-a068-4dfb-a98a-4e058a533abd","resolution":{"observed_at":"2026-08-15T18:03:16.758204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.138673Z","title":"SKILL: structured knowledge infusion for large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.138673Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:a5846d9a79c9ff42fca6e980fbbe2534f872d63991573476072a965fb3f5514f","observation_id":"0faf971c-8388-4047-b042-60b13998e140","resolution":{"observed_at":"2026-08-15T18:03:15.138673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i11.26596","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.738122Z","title":"Contrastive learning reduces hallucination in conversations,","venue":null,"work_id":"fd9510db-35fb-4b73-8575-6319f721abbc","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.143255Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:2d0467685cd749040911321fe794f7e9b6e272ddf60390b02a9a97d673229d50","observation_id":"4cb5748c-c181-4272-9707-55de5f7821af","resolution":{"observed_at":"2026-08-15T18:03:16.742961Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T18:03:15.148064Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.148064Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:ef5735d35055083df42c08f6a02127cac77746d37c300c0fb1dbd2c5e67f1231","observation_id":"8b54acc6-1798-464c-91bf-c21693d8f3b5","resolution":{"observed_at":"2026-08-15T18:03:15.148064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-15T18:03:15.157880Z","title":"Mechanistic interpretability for AI safety - A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.157880Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:a7c11f5a8c4d7deff773519c82ef5ad3ff9c1d460de382acc1e60abf5f8eb0b6","observation_id":"1461a0bd-247b-476f-81a4-fffb29c0e41e","resolution":{"observed_at":"2026-08-15T18:03:15.157880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.722355Z","title":"On the dangers of stochastic parrots: Can language models be too big?","venue":null,"work_id":"83443d5d-288d-463b-96d2-4842f573f390","year":2021},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.162661Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:a002dad43eb9993637d06d707450b46792b7ad0376b819052368081c75e64ab1","observation_id":"3e875050-bdb9-4f1b-9283-55b503193cb2","resolution":{"observed_at":"2026-08-15T18:03:16.727790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-18T22:17:47.865607Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-15T18:03:15.171506Z","title":"Sparks of artificial general intelligence: Early experiments with GPT- 4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.171506Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:39aa7c03f323d15eda4c2019eba59ca98fe7f56f9f77d418409db26e9e2a2ee2","observation_id":"e2439061-1e03-432d-9905-3a696d96c87d","resolution":{"observed_at":"2026-08-15T18:03:15.171506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T18:03:15.176522Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.176522Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:dd3f2ca1baad993d28ef285cba9706f24f6ef0c65a47daefd7905359e6826552","observation_id":"26aa5c46-90c4-41e5-86b4-be766c1a27e7","resolution":{"observed_at":"2026-08-15T18:03:15.176522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.707303Z","title":"Microsoft Bing: Get to know Bing,","venue":null,"work_id":"02b827c3-ea16-4e2f-85fd-94ca250e0149","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.185968Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:6d245447071767afc8c857ca0098147087f1c712d63c0b87304b4ca94e45f264","observation_id":"b589ed74-e21d-4091-87d5-2473db998aca","resolution":{"observed_at":"2026-08-15T18:03:16.712392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.676150Z","title":"[Online]","venue":null,"work_id":"7250e127-2812-41c2-93a6-b655f33e1602","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.195095Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:b13572f9a3dfc67688cd86a555514ac6edf00ce00b9c4f7df13d2be2aa021ab5","observation_id":"f5384afd-c889-400f-ba3c-8c6333b7c8d6","resolution":{"observed_at":"2026-08-15T18:03:16.680863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.661314Z","title":null,"venue":null,"work_id":"42a0693c-847e-4b09-a43c-65c9b8318ad0","year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.199452Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:8d4e1c09465fcb0c6cab05be02ea531f8ac2d567afda4518a81335c48ed545b9","observation_id":"14189d15-bb15-4b9c-b4af-dba1b88fafe2","resolution":{"observed_at":"2026-08-15T18:03:16.665886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.646737Z","title":null,"venue":null,"work_id":"7ec5320e-48a0-499b-bb20-c2208612b842","year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.203943Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:069ece78f4cc51ec3ec09f1589b76ad8e302a18e4e5fa504e7a0da71a8fe9128","observation_id":"ca075c6c-b6f4-482d-962e-e4e02412d3e5","resolution":{"observed_at":"2026-08-15T18:03:16.651350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16092","last_updated":"2026-06-08T08:40:57Z","snapshot_observed_at":"2026-08-16T15:20:27.587232Z","submitted_at":"2023-06-28T10:48:34Z","title":"Chatlaw: A Multi-Agent Legal Assistant based on a Role-Aligned Mixture-of-Experts Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16092","snapshot_observed_at":"2026-08-15T18:03:15.208124Z","title":"Chatlaw: Open-source legal large language model with integrated external knowledge bases,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.208124Z"},"links":{"cited_paper":"/paper/2306.16092","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:f641705fd4c0c39e54d015eec741ab5a92fefd079c26559f63f94680ae9bc4b2","observation_id":"0386fc58-86dd-4e69-82b9-c1bd0fa82b1b","resolution":{"observed_at":"2026-08-15T18:03:15.208124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.691743Z","title":"Available: https://www.microsoft.com/en-us/bing","venue":null,"work_id":"fc060e54-1331-4ed5-afc7-2b65346b2696","year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.190506Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:0aeecb49e2e9b5e74d3b3275e84fba4f00b093add2148c9eba6669d6aa2f43b3","observation_id":"b27f6346-904f-4d31-b57d-483dcd3c058b","resolution":{"observed_at":"2026-08-15T18:03:16.696479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.616373Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":"bc54703e-b6ac-485e-8fb6-82f8d15e5530","year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.221491Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:d07c265d0626c11bc06db4c04e21741aec84b15d5fb2d61deb7e02f052467620","observation_id":"76e5f2bb-69a3-4141-9ef1-914304b0c6d1","resolution":{"observed_at":"2026-08-15T18:03:16.621437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-19T02:54:55.334346Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-15T18:03:15.225818Z","title":"Webgpt: Browser-assisted question-answering with human feedback,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.225818Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:4e7f617edb364a5e39f2ab0d5f4c2cb826bbefcd8f00da88dbeb4420bd3f7a8f","observation_id":"715d0362-a11b-491c-8cd7-4fe1e6eafcbe","resolution":{"observed_at":"2026-08-15T18:03:15.225818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.230528Z","title":"Webcpm: Interactive web search for chinese long- form question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.230528Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:e5f8120094e4d794b1eb39b6f859fb2daa69ab143f83a20790a2a019bc7cc275","observation_id":"559b081b-0c80-4b74-915f-6345a752d75e","resolution":{"observed_at":"2026-08-15T18:03:15.230528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.591190Z","title":"The reversal curse: Llms trained on","venue":null,"work_id":"95cd54a8-af5e-4cd4-9655-b88c34c41c63","year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.235013Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:8688bd08a8d02054d088c87ce484b5d8333d3803d7b0c77def5367319600c342","observation_id":"f7329238-d0d6-44c3-a748-366e42d93b7c","resolution":{"observed_at":"2026-08-15T18:03:16.596007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.631770Z","title":"Survey of hallucination in natural language generation,","venue":null,"work_id":"8c6702de-cf82-4b50-abf1-18f392e15384","year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.212747Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:b421e6de07060110ef1e9c0e30bc142d2a722255bbab0d1884f085a348084910","observation_id":"0bda6a5d-60e8-4ce0-b4f4-756fa9a48ec9","resolution":{"observed_at":"2026-08-15T18:03:16.636748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.217039Z","title":"Available: https://doi.org/10.1145/3571730","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.217039Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:975766faaad03285476a099199ac7506499c024b157e18fd178b308c8bfdbce8","observation_id":"928116c9-de0f-43ce-8e46-b357386115d7","resolution":{"observed_at":"2026-08-15T18:03:15.217039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.252829Z","title":"MISGENDERED: limits of large language models in understanding pronouns,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.252829Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:460e94d8f7ef1c63b3872ee6bb7d325bfd0b33ec694df25d87845c35165cbeef","observation_id":"a8b1339a-ba1c-40ef-b4db-252f153fd464","resolution":{"observed_at":"2026-08-15T18:03:15.252829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.257431Z","title":"Knowledge neurons in pretrained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.257431Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:ec242becad611e1a85b51b2bd6a92c936a7fc6c272497a21bcd65b0522c8a867","observation_id":"9ce2cc9b-185e-490f-a00a-e11137e6246f","resolution":{"observed_at":"2026-08-15T18:03:15.257431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.561354Z","title":"Locating and editing factual associations in GPT,","venue":null,"work_id":"57c19a55-9c68-45e6-886a-ec3cbc812198","year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.261672Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:c530ae225623fb050993421488ff962b65b6b79a9292a9d55565b73c700df17d","observation_id":"46cf68bc-395a-4ef4-bde2-cfcc16163b02","resolution":{"observed_at":"2026-08-15T18:03:16.566089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.545173Z","title":"Improving factuality and reasoning in language models through multiagent debate,","venue":null,"work_id":"a303778f-447e-4a5f-ba56-bf278fa20efd","year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.266237Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:cd3833e1dc012106795c4eee1c222650669def250e2a9ae653b9d95924e9615e","observation_id":"7a1cf624-05dc-4f02-a156-d9f08fc58eff","resolution":{"observed_at":"2026-08-15T18:03:16.550476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.576107Z","title":"Understanding catastrophic forgetting in language models via implicit inference,","venue":null,"work_id":"12ebcc84-299e-471d-946e-b2c52a16fcef","year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.239779Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:9843b347654ecd24947dc64f099e29c6821e2dd5bfba2031e6331d6f988d044c","observation_id":"b1192ac6-21eb-4fed-8d84-d5ada10471d4","resolution":{"observed_at":"2026-08-15T18:03:16.581022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00770","last_updated":"2024-07-12T20:29:57Z","snapshot_observed_at":"2026-08-17T15:11:29.607519Z","submitted_at":"2023-09-02T00:32:55Z","title":"Bias and Fairness in Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00770","snapshot_observed_at":"2026-08-15T18:03:15.244043Z","title":"Bias and fairness in large language models: A survey,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.244043Z"},"links":{"cited_paper":"/paper/2309.00770","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:06b1f3d177ae37661e62926e7d594d39ea7e912ec29e7f44b747d8c2dd89f687","observation_id":"8a8a640f-38fc-4591-935f-35ff28a86700","resolution":{"observed_at":"2026-08-15T18:03:15.244043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00770","last_updated":"2024-07-12T20:29:57Z","snapshot_observed_at":"2026-08-17T15:11:29.607519Z","submitted_at":"2023-09-02T00:32:55Z","title":"Bias and Fairness in Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00770","snapshot_observed_at":"2026-08-15T18:03:15.248522Z","title":"Available: https://doi.org/10.48550/arXiv.2309.00770","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.248522Z"},"links":{"cited_paper":"/paper/2309.00770","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:fc9adb35cfd6faf0c32432b4b5a1216fc52eeba3b021e7ccbeb186f7eec6fcf0","observation_id":"7e2dfbe5-f929-45c6-ad0a-786c7a9b4a94","resolution":{"observed_at":"2026-08-15T18:03:15.248522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.500767Z","title":"Dola: Decoding by contrasting layers improves factuality in large language models,","venue":null,"work_id":"a2eb1067-33a6-480c-ac0d-dfc8794799b6","year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.283636Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:c71812b89e0f79262a982be39df2d064bddf1b37fdaf6294eef88dc55b4d5959","observation_id":"13d67ff1-81f3-40fe-a878-a78b5149c074","resolution":{"observed_at":"2026-08-15T18:03:16.505457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.485759Z","title":"Improving language models by retrieving from trillions of tokens,","venue":null,"work_id":"ab6a18a9-900b-4de4-b8ba-489dca8d373e","year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.288064Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:fe8b5592f9d32b65a2ea41ff37239a6d07cd3b338065d5fbdf9701d950c7d759","observation_id":"2f2eede1-b76a-497b-a974-34a5e89c215a","resolution":{"observed_at":"2026-08-15T18:03:16.490560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05115","last_updated":"2022-05-23T16:41:08Z","snapshot_observed_at":"2026-08-18T13:49:25.475974Z","submitted_at":"2022-03-10T02:24:14Z","title":"Internet-augmented language models through few-shot prompting for open-domain question answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05115","snapshot_observed_at":"2026-08-15T18:03:15.292797Z","title":"Internet-augmented language models through few-shot prompting for open-domain question answering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.292797Z"},"links":{"cited_paper":"/paper/2203.05115","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:0d9ec33c0aa3e77e7dd2784d8463441801a1a2829ba2befac62e1d4647ba4cea","observation_id":"04a1613a-439a-4e90-9fd8-ad2f8450207e","resolution":{"observed_at":"2026-08-15T18:03:15.292797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00303","last_updated":"2022-12-31T22:35:34Z","snapshot_observed_at":"2026-08-17T19:28:49.631817Z","submitted_at":"2022-12-31T22:35:34Z","title":"Rethinking with Retrieval: Faithful Large Language Model Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00303","snapshot_observed_at":"2026-08-15T18:03:15.302072Z","title":"Rethinking with retrieval: Faithful large language model inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.302072Z"},"links":{"cited_paper":"/paper/2301.00303","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:0128b3e4c36f0f95760b4f85f66b3d5f31707da2e3ffbd31fac55dfe6085fb73","observation_id":"184e045a-675c-4fa9-a5fd-cd3289174221","resolution":{"observed_at":"2026-08-15T18:03:15.302072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.270542Z","title":"LM vs LM: detecting factual errors via cross examination,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.270542Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:1f18f8b0f95450d2aa96590d71d7f9c9485e09292e0b58ee71fc6bb14bc58041","observation_id":"456833a8-8fea-4aa8-b915-ef5809a1e2eb","resolution":{"observed_at":"2026-08-15T18:03:15.270542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.529597Z","title":"Generate rather than retrieve: Large language models are strong context generators,","venue":null,"work_id":"8ad1e5ca-e60c-45b7-850f-888921ffc72c","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.274844Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:78eaecdd3bf1f360594913fbc2c10a1379a863b2464789f407e24527ff5186b9","observation_id":"b0c610ac-83b6-4e09-8fff-61838567a76e","resolution":{"observed_at":"2026-08-15T18:03:16.534423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.515565Z","title":"”according to","venue":null,"work_id":"db8a628f-0791-41e8-b8a5-404c8b6c50f5","year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.279249Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:09d8008d3de429403f71f16beb41c8e882a7fb566fd4c475cfd093f3fc7d4922","observation_id":"7c03668b-0cf7-4ec4-bef5-cbec39ad4d73","resolution":{"observed_at":"2026-08-15T18:03:16.520011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15225","last_updated":"2023-06-25T17:56:37Z","snapshot_observed_at":"2026-08-17T19:28:49.342797Z","submitted_at":"2023-05-24T15:07:30Z","title":"SAIL: Search-Augmented Instruction Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15225","snapshot_observed_at":"2026-08-15T18:03:15.320474Z","title":"SAIL: search-augmented instruction learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.320474Z"},"links":{"cited_paper":"/paper/2305.15225","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:31b1e843ca9518690cc7c48bcc6beacce7dd02a8c6fa2a8dcdae70831e290375","observation_id":"0053207f-b76d-465c-9c10-021ffe283d98","resolution":{"observed_at":"2026-08-15T18:03:15.320474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.444694Z","title":"Decoupled context processing for context augmented language modeling,","venue":null,"work_id":"ff151c6e-e7bc-4241-9042-4a9efd63e04e","year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.325340Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:2f9fed7070a67cf9ec3749cce5ff8e0d2a73d5408da114a40f6a90ee5be54ad3","observation_id":"afc209e6-ea1d-447c-ba99-250469990d92","resolution":{"observed_at":"2026-08-15T18:03:16.449676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.441","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.627509Z","title":"G-MAP: general memory-augmented pre-trained language model for domain tasks,","venue":null,"work_id":"4d2a605b-40de-4a1f-abb5-49f687e56897","year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.329994Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:f2a8fae1b5a8daca8d28a972a514b80cfa1d6cb10993edeb9c5d05956cf6782c","observation_id":"54223f28-3cf7-4c84-8fc9-35be5a160c0a","resolution":{"observed_at":"2026-08-15T18:03:15.633949Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13669","last_updated":"2024-06-13T03:44:03Z","snapshot_observed_at":"2026-08-17T19:28:46.378180Z","submitted_at":"2023-05-23T04:22:50Z","title":"The Knowledge Alignment Problem: Bridging Human and External Knowledge for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13669","snapshot_observed_at":"2026-08-15T18:03:15.334546Z","title":"Mitigating language model hallucination with interactive question-knowledge alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.334546Z"},"links":{"cited_paper":"/paper/2305.13669","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:edf1c21294c8033757b92b8459748720b458f87625cde8177e47665722605cab","observation_id":"1f20ef7d-40a0-4bec-ba68-9acc7787aa29","resolution":{"observed_at":"2026-08-15T18:03:15.334546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.339758Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.339758Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:44836055acd6dea570928e3e4560e819b43fc8209e74d56c9798896305c4156e","observation_id":"7a37df6f-29b3-4ca4-97cf-413fb9b8c2f9","resolution":{"observed_at":"2026-08-15T18:03:15.339758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.306845Z","title":"Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.306845Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:0c74d83e450d23a3403e22047c9acfdb4d9003b8fe1964558d7e7feb1b492568","observation_id":"5c0bb3d0-5fd7-40b9-bd31-9a0f4c362cbc","resolution":{"observed_at":"2026-08-15T18:03:15.306845Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.469542Z","title":"Atlas: Few-shot learning with retrieval augmented language models,","venue":null,"work_id":"32042de7-2ad5-4f9d-940d-03832cfe7942","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.311660Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:281093869085bcacf21476a297d85dab86ebf2b1d99653c069a72173f8d1c35a","observation_id":"6d086de5-e5b8-4a23-9386-6c76f13245af","resolution":{"observed_at":"2026-08-15T18:03:16.475090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.316124Z","title":"REPLUG: retrieval-augmented black- box language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.316124Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:474da05f8bd309437130f7d55414d07935d6633b2fbceddb1b4dd5ec921263f6","observation_id":"5d7cab6a-d398-45cb-9c58-1d26511bb7f7","resolution":{"observed_at":"2026-08-15T18:03:15.316124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-08-16T13:52:21.979655Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-08-15T18:03:15.357576Z","title":"Lora learns less and forgets less,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.357576Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:715066da7035a3f830ef07f49f14c9b325dcc9cc4bf47c0e0a3e0fb34278de20","observation_id":"3cfadc84-5c2e-4228-8832-5abc2a0321fc","resolution":{"observed_at":"2026-08-15T18:03:15.357576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.386640Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"60da2719-5fd3-4b91-9c68-b009f608df9e","year":2019},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.362191Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:1e380d7580047d28cb804e872ff7f34bf37464711ee107a35e2e649fab448ca7","observation_id":"2239fb46-80d1-49ce-8f4b-9211b30804ca","resolution":{"observed_at":"2026-08-15T18:03:16.391642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T18:03:15.366675Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.366675Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:12f4afb097f91ecd9dfbc39be1e6bf3a0948c133b2f16f50dc244912edd9369b","observation_id":"de75e81d-39e3-4939-8d72-b9703538d3ad","resolution":{"observed_at":"2026-08-15T18:03:15.366675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-16T14:09:52.485275Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-15T18:03:15.371184Z","title":"A systematic survey of prompt engineering in large language models: Techniques and applications,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.371184Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:99905c80bffb5f913c1da2ad19df216c2decea5d3f177a2bbbae1f8dd5117117","observation_id":"9af4a418-ec9d-42f7-a66f-ddc5ba04a6a4","resolution":{"observed_at":"2026-08-15T18:03:15.371184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T18:03:15.380576Z","title":"A survey on llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.380576Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:5b002f20f62441fea9fb79a7539c62bf8d27280fda7c45ff63aca6bda40af162","observation_id":"291a3523-2418-4374-8a24-16168096b4c8","resolution":{"observed_at":"2026-08-15T18:03:15.380576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.419481Z","title":"FLAIR: An easy-to-use framework for state-of-the- art NLP,","venue":null,"work_id":"4d64561a-f295-4a5f-b147-ae121d4e05e6","year":2019},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.344107Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:869d999ac3bdced3030510e313bb9976d9fae2e8cb1d75fba735b95809b818af","observation_id":"acc37e6c-6a6b-48ff-a366-79824e0a04c8","resolution":{"observed_at":"2026-08-15T18:03:16.424176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.348513Z","title":"Instruction tuning for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.348513Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:b313e6e018c599bae789e7fa2743f7c865306f53cfc8c3b2b76d37b17d1c2431","observation_id":"450acbdb-be2d-4714-90ca-a5bfaec99d70","resolution":{"observed_at":"2026-08-15T18:03:15.348513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.403309Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":"2dd3e3fb-b470-43f9-abea-6db54248a66a","year":2022},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.353075Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:ecd27dffa9142683e66aa93d7273f2bfca387476969dac96196dc67f45a966d9","observation_id":"03fd2163-99c4-4688-8658-abbb84329f4b","resolution":{"observed_at":"2026-08-15T18:03:16.408784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.340789Z","title":"Lighteval: A lightweight framework for llm evaluation,","venue":null,"work_id":"10d5210d-1db3-4a30-b4b2-6dbca7372674","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.407860Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:d55d179db3c9872a01c2b7d82427ca3677b4c32ea72a9a2b6a0e075256f81df7","observation_id":"a8ee7b24-83d0-4bd9-b38f-c879b987989a","resolution":{"observed_at":"2026-08-15T18:03:16.345793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.325420Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":"5c097b0d-029f-4098-a017-4b206c492131","year":2023},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.412408Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:347957385cacf82db17636d050c5826635b0cd6f7535d697e3cef27f45fb3ee6","observation_id":"f3f3a85f-81f4-485b-b111-13ea0cf93655","resolution":{"observed_at":"2026-08-15T18:03:16.330377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-16T16:49:08.285566Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-15T18:03:15.417052Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.417052Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:e6f8ed13576f1d651cf11c6efedbbac66259194754530bf58ffa1139f657c91c","observation_id":"ef580638-c827-423f-b193-3e9c54128cf6","resolution":{"observed_at":"2026-08-15T18:03:15.417052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-16T14:09:52.485275Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-15T18:03:15.376088Z","title":"Available: https://doi.org/10.48550/arXiv.2402.07927","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.376088Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:66d80249c9b1b87c76c9116579906eb337f65352e866b4c6ef32cb9301e04004","observation_id":"f684f81b-bfc8-496d-87b7-22b60993e257","resolution":{"observed_at":"2026-08-15T18:03:15.376088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.371563Z","title":"Open r1: A fully open reproduction of deepseek-r1,","venue":null,"work_id":"75185093-11f5-4023-8d96-a43dbb40f4b5","year":2025},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.385074Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:332102985d46a1ac99a1dc80c30288c5c745961490717c23b025483ff54d699a","observation_id":"24df5dcb-a85c-4355-81b9-2ec94314926a","resolution":{"observed_at":"2026-08-15T18:03:16.376272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:16.356561Z","title":"Gemini 2.0 flash,","venue":null,"work_id":"c381f667-e7dd-4b7c-9e10-2d5f99d8e86b","year":2025},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.389343Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:f9da3603cf5890dde3c8dead027499bf895e0ec190cc03fa88972d536b748ab2","observation_id":"80afaed0-6d58-4f34-8660-bd58f1d3a721","resolution":{"observed_at":"2026-08-15T18:03:16.361249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-15T18:03:15.393616Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.393616Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:065b93916c9550b71f2c72fd488e1018cce2660f9334493e13f65355ac71595d","observation_id":"36c1c478-8bdb-49fd-8a1c-a4f9eae35fdd","resolution":{"observed_at":"2026-08-15T18:03:15.393616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-16T16:49:08.285566Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-15T18:03:15.421740Z","title":"Available: https://doi.org/10.48550/arXiv.2207.00032","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.421740Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:5b88e1591f8c66e9af6d1e0b9b1f6de187ac8487194bb2bba818134bebefcfb4","observation_id":"c331b2c8-9376-400f-81ec-44c44298a02d","resolution":{"observed_at":"2026-08-15T18:03:15.421740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.426142Z","title":"An analysis of encoder representations in transformer-based machine translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.426142Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:5046fcba8ee051448326a6f6caadb5e9f2730bd074ed9d7ea1af527f5c69bb36","observation_id":"d2ee8123-3fea-457a-9d42-8e0d9ecfbdd8","resolution":{"observed_at":"2026-08-15T18:03:15.426142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:03:15.167069Z","title":"Available: https://doi.org/10.1145/3442188.3445922","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":623,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.167069Z"},"links":{"citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:b40f160c3b581db9e081c1965dc61df1d4e9e235d69a88ee92510d08483b1172","observation_id":"a3c5881c-adba-43e6-ae71-bf288a10697e","resolution":{"observed_at":"2026-08-15T18:03:15.167069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-15T18:03:15.403479Z","title":"Available: http://arxiv.org/abs/1910.03771","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.403479Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:2b771dfcc07d72a413a3b5ffac37d6128d03895926ee0fae32b660d178c14868","observation_id":"9227a4b4-1a4b-4cc3-8a05-906517eae6a1","resolution":{"observed_at":"2026-08-15T18:03:15.403479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05115","last_updated":"2022-05-23T16:41:08Z","snapshot_observed_at":"2026-08-18T13:49:25.475974Z","submitted_at":"2022-03-10T02:24:14Z","title":"Internet-augmented language models through few-shot prompting for open-domain question answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05115","snapshot_observed_at":"2026-08-15T18:03:15.297259Z","title":"Available: https://doi.org/10.48550/arXiv.2203.05115","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.297259Z"},"links":{"cited_paper":"/paper/2203.05115","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:3dec45efec661daebd614c7ee8e2b6fd52063ffd7da4f652420ec633129131a5","observation_id":"518519e3-ca66-492f-af2a-c65d80a00a9e","resolution":{"observed_at":"2026-08-15T18:03:15.297259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T18:03:15.181466Z","title":"Available: https://doi.org/10.48550/arXiv.2303.08774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.181466Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:0e546470e3aa71011d4245c3516999bfadd035d6f419e740874e79d1259b6077","observation_id":"21e9eb86-ad22-4b40-aba5-dc4d67e50d0b","resolution":{"observed_at":"2026-08-15T18:03:15.181466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T18:03:15.152972Z","title":"Available: https://doi.org/10.48550/arXiv.2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.152972Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:d2f1478aaea3480f5570df4eca3e6bd63ebfe8f97955cee3be2e15c310de21d0","observation_id":"9e7d88cc-daad-4bb5-8de9-6eaaeef674b6","resolution":{"observed_at":"2026-08-15T18:03:15.152972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T18:03:15.068746Z","title":"Available: https://doi.org/10.48550/arXiv.2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T18:03:15.068746Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.22940"},"observation_digest":"sha256:8dd5ac5a0e1f122c84dff4050203c9de641f111975bc7ab8efb936c67a7c6edd","observation_id":"c0924e61-864d-4718-93ad-d217650a8504","resolution":{"observed_at":"2026-08-15T18:03:15.068746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22940","last_updated":"2025-08-02T10:16:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T13:54:23.332911Z","submitted_at":"2025-07-25T10:34:51Z","title":"Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 2 inbound Pith citation observations for arXiv:2507.22940."}