{"as_of":"2026-08-07T19:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8ce67f3365ebd414c1b64dcf822e316e6973615aed82bb39353f85d2ef75436","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:17.785500Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:24.782504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:27:24.497080Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-08-07T12:59:24.782504Z","title":"https://doi.org/10.48550/arXiv.2505.22113","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22987","last_updated":"2025-07-17T20:04:13Z","snapshot_observed_at":"2026-08-07T12:53:33.593667Z","submitted_at":"2025-05-29T01:51:20Z","title":"Strategic Reflectivism In Intelligent Systems","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.782504Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2505.22987"},"observation_digest":"sha256:42ffac42f0ff422f211dd95116f4a4db1d31ce5b3049c13f1459ee710cd365f7","observation_id":"a4fcd218-24f4-4bd3-89f4-9ed46bc3b58e","resolution":{"observed_at":"2026-08-07T12:59:24.782504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2507.04023","last_updated":"2026-04-23T08:06:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-05T12:31:17Z","title":"Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T06:25:12.799097Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2507.04023"},"observation_digest":"sha256:17a186c63820efe067e0ebb4850cd4ea6a34b02ca875663f902f014c2821a0f5","observation_id":"fcf09946-aa25-42e3-84b2-db2d72a9a230","resolution":{"observed_at":"2026-05-19T06:27:07.313600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-08-06T17:54:17.162463Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-07T01:15:50.475193Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.162463Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:984e93c43005ff08d95a2c3a2c4503072c9385bcf1eb03589e43f56311ec9be5","observation_id":"9f5055de-f5b5-42b8-8bc3-4c8f0321b50f","resolution":{"observed_at":"2026-08-06T17:54:17.162463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2511.23253","last_updated":"2026-05-17T14:28:57Z","snapshot_observed_at":"2026-08-02T03:33:31.761191Z","submitted_at":"2025-11-28T15:02:19Z","title":"AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:42.921867Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2511.23253"},"observation_digest":"sha256:9b497f4a57f0cd96cd4340c55d5125c8e8d142a3fe726742db9aa4a018da9cd0","observation_id":"3753c99a-84be-4992-9af0-af1dace88f70","resolution":{"observed_at":"2026-05-21T18:00:26.865491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2604.12214","last_updated":"2026-04-14T02:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T02:48:29Z","title":"Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:18:42.321975Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2604.12214"},"observation_digest":"sha256:9562d9fb12620e275bc790d6a0b28f28fcc77e3b9f1789a4e91dd9b1e2f28d56","observation_id":"823da83a-998a-40b9-9eb6-47c105ff82a4","resolution":{"observed_at":"2026-05-11T10:46:06.021781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2605.02290","last_updated":"2026-05-04T07:26:41Z","snapshot_observed_at":"2026-08-02T10:20:40.458806Z","submitted_at":"2026-05-04T07:26:41Z","title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-09T16:29:05.186607Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2605.02290"},"observation_digest":"sha256:ac3b29bac28d58985688fc26796d500bf14b07d2a3f0c24b163062ee55b2b2ad","observation_id":"f24ec194-6adf-4669-a666-cc30c21e49b5","resolution":{"observed_at":"2026-05-11T16:31:09.086035Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2605.14084","last_updated":"2026-06-09T19:01:29Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T20:09:35Z","title":"CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T04:45:39.641535Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2605.14084"},"observation_digest":"sha256:32d82f84cefafe2e48fac64a51b8a940dc03f043c273bb25c6acf4497f4b4f16","observation_id":"c7bc5be2-94be-4ac2-a0a3-5254c7bb8527","resolution":{"observed_at":"2026-05-15T04:49:44.557913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2605.14084","last_updated":"2026-06-09T19:01:29Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T20:09:35Z","title":"CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T21:12:37.353935Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2605.14084"},"observation_digest":"sha256:d0e7db43136779d1d98bead7e6f30955762b5698b711f2692f69b483191cc622","observation_id":"c28731c9-63ec-462c-a515-ebf21fbfbbb2","resolution":{"observed_at":"2026-06-30T21:15:04.194995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2606.07968","last_updated":"2026-06-06T03:52:27Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T03:52:27Z","title":"RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T19:45:30.671490Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2606.07968"},"observation_digest":"sha256:3ea41af48a9dc78e9333dd9a372f2f695de7516cfc1dde29737d9b77239bf934","observation_id":"1243446f-35a8-45ae-9684-bb4a006b1d33","resolution":{"observed_at":"2026-07-02T21:27:24.499140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2606.29067","last_updated":"2026-06-27T19:56:55Z","snapshot_observed_at":"2026-08-05T18:15:40.143418Z","submitted_at":"2026-06-27T19:56:55Z","title":"ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-30T09:23:26.386399Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2606.29067"},"observation_digest":"sha256:f12083e4a1a32fdf1c2a6591277eeada0ec356cf49f41a182cf9507840d77173","observation_id":"864d426a-3310-4c57-a10c-2c3373f1cc2a","resolution":{"observed_at":"2026-06-30T09:24:32.223129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22113/citation-record","integrity":"/paper/2505.22113/integrity","json":"/paper/2505.22113/citation-record.json","paper":"/paper/2505.22113"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.795279Z","title":null,"venue":null,"work_id":"4cacee50-8792-4013-b6c3-06e7b3b1d5ca","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.730171Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:beb9695b05e468aa041ed084a1f933360b752ff81639a0efdecd7f921f6a33b4","observation_id":"c384100b-c8b7-4d1c-b309-d55a9f9c7178","resolution":{"observed_at":"2026-08-07T13:20:21.917705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.548875Z","title":null,"venue":null,"work_id":"9d22a9d4-ccf3-4155-b3f5-e61ea4be98fd","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.874746Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:caa94306bf5e31c8db1bc3fac95f15dd1fc324ebe35c181c2f4709cc1c022bd9","observation_id":"ac1eb0a1-e109-406b-988f-f90903cd7299","resolution":{"observed_at":"2026-08-07T13:20:21.651898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.316635Z","title":null,"venue":null,"work_id":"e120cb3b-0444-45d8-b31d-4d0680046244","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.990072Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:0f31edacd9f05baf6b8d8d57176c4849574c5a5518cb87bd6d328b4f29cfe086","observation_id":"93ab8204-0496-486f-bde8-8f826a067208","resolution":{"observed_at":"2026-08-07T13:20:21.425334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.038675Z","title":null,"venue":null,"work_id":"9c0b49c3-44fb-44fb-a984-0fa24fa9f84b","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.095136Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:0eb913d1266b9c5b4b2b5b69eaf0020c0d45b3d20b7cb0429c345daf20d5ed46","observation_id":"b24a198a-bec0-47a7-b87b-9f14c1907439","resolution":{"observed_at":"2026-08-07T13:20:21.182153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.828896Z","title":"solution1","venue":null,"work_id":"380c22ad-7ee4-4b74-b4f9-53eaa57152f9","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.203468Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:94eb088224d8efb27134935b918810f816eef18ed18ac47c24864a46d725c621","observation_id":"e93cbc2c-dc6f-4737-836a-fe532de576a4","resolution":{"observed_at":"2026-08-07T13:20:20.896976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.332107Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.332107Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:8ff8167999675b25875ca1cdde5cacffa6101eb6f1e4a002d221cdac815ddfb9","observation_id":"b0690b8e-de93-40a9-ab65-9a913a55ab7b","resolution":{"observed_at":"2026-08-07T13:20:15.332107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.410585Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.410585Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:06caebdcaff7f299cda2cdb3fed7d0e23f3427877c62c26ad12fae215e6219e6","observation_id":"b94e670f-245b-4ca8-b275-77d94a51c5de","resolution":{"observed_at":"2026-08-07T13:20:15.410585Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.623431Z","title":"step_index","venue":null,"work_id":"35f0bb82-bf43-4534-98da-9d797a0c3ca8","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.541578Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:26057e2ff89e0b2aadb56174efb6fff345f5d8f1fcdc098e85f4f7a217ae3c3e","observation_id":"a0f55e05-4ba8-4f10-b81a-5675b489ce45","resolution":{"observed_at":"2026-08-07T13:20:20.723877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.377642Z","title":null,"venue":null,"work_id":"ff9a23f2-2d48-4df9-a0f1-c738a41465f1","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.647111Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:603765cf3aa77cb5a5feb7441a87768298bbeafa49f01952ddc9ef133fe5f954","observation_id":"8d26cb6c-619a-45ca-9630-2699465649da","resolution":{"observed_at":"2026-08-07T13:20:20.470923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.112033Z","title":"correct_answer","venue":null,"work_id":"278bd4a7-b318-4aed-bb24-dd48db59436b","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.714787Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:97fc8c03d918294707b80ae99ee6533e904a0a253d609d80262e3d531af2ac15","observation_id":"03e0ef78-1002-4995-902a-e9e024f821a1","resolution":{"observed_at":"2026-08-07T13:20:20.257129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.844503Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.844503Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:1ba1de6fe06e65dc8bd5146ea13cb0dce0a684a74b3fffb32587edd8fed0c961","observation_id":"aef9f10d-7f23-4bb8-8aaf-f09ab6276f2d","resolution":{"observed_at":"2026-08-07T13:20:15.844503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.861672Z","title":"Match\": Aligns with ground truth -","venue":null,"work_id":"528dc469-2335-43e4-ac71-59347785161a","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.969033Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:7ce1309bacb3394d0bf65dd93589d657117cb448e2edfdd6c02b803da8ba82e4","observation_id":"b14553b6-303f-45e2-8cb1-4b2373b2aad6","resolution":{"observed_at":"2026-08-07T13:20:19.984932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.007807Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.007807Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:4da837e8f2cf5c853070645984b11f1c69f89fb1c29438d1f2bade4684767472","observation_id":"8cbf3a86-79be-4057-ae6e-b8ff97544a75","resolution":{"observed_at":"2026-08-07T13:20:16.007807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.097596Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.097596Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:bcb6131fdf7eefd3c2fc7c689ff1e68ae0d10b6a602cf0e3b8c42c9fbd408807","observation_id":"fb0856b0-a0ac-4267-b70a-af6bcb28aae7","resolution":{"observed_at":"2026-08-07T13:20:16.097596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.556829Z","title":"Always include the final step that contains the answer","venue":null,"work_id":"69b3a7b0-c162-4933-bf9f-625d7dd9f800","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.225473Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:b84436048e20975e72e149b736cc623681a7581a7986b9ca651460734e068c2d","observation_id":"40bbb535-5b02-4e5c-af68-02dfae855d04","resolution":{"observed_at":"2026-08-07T13:20:19.720710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.337406Z","title":"step_type","venue":null,"work_id":"8b338f97-8fec-4c94-9c12-475d4916befa","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.407694Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:975e53619129364a2c57350807c97ae796c2e581d33a02be9c9c90b0ad792130","observation_id":"f4f114d5-2c3a-40ea-8af4-a05d4cd84ba3","resolution":{"observed_at":"2026-08-07T13:20:19.432023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.505667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.505667Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:0eb999a363cc225156d04a160df539dbf33da73917d7651e6213e69a46775c76","observation_id":"74c47502-d618-4397-8d1f-e3632be3252b","resolution":{"observed_at":"2026-08-07T13:20:16.505667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.982449Z","title":"19 Invalid reflections include:","venue":null,"work_id":"7d76fabf-c47a-4908-84cb-dc9f721d7fd2","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.674204Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:02fa49cb8195839b91948de234a92ea0e3d6b219614e4d2c85ad10c5d0eff6ea","observation_id":"839a257e-a783-4f7a-a736-932603356af4","resolution":{"observed_at":"2026-08-07T13:20:19.156441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.761555Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.761555Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:02777a212446ebe9405b17105400ab1e359fba00c5bee35c07ed57d06d8d915a","observation_id":"ad604f45-77b5-4b0c-819c-8c47d608303e","resolution":{"observed_at":"2026-08-07T13:20:16.761555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.841406Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.841406Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:193e30e9b4dc5beedd7271afb54c56515f854d768e4e3651798d7ca2dc812b19","observation_id":"838ee48d-2e6b-4dcd-8579-6b0d44f19a8a","resolution":{"observed_at":"2026-08-07T13:20:16.841406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.934380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.934380Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:3541c608d4b6a98deaaef0461dc655712c8a7440df326d7b6b26ba21f46cd604","observation_id":"72863295-368d-4bbc-90bd-91da3ac42c22","resolution":{"observed_at":"2026-08-07T13:20:16.934380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.577687Z","title":null,"venue":null,"work_id":"8beebad1-ed89-4b9f-b602-e919ffe0a265","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.164581Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:67a1b629dcf36e9682b14ff406ef897d212709739d5d8dfa64da39653fc49954","observation_id":"26672661-3b2d-440b-a9cd-7bf058668dfc","resolution":{"observed_at":"2026-08-07T13:20:18.783558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.242820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.242820Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:524f19d040a64832f0d4c8e9c04e2257bc69987aecbfb2da191fc137268fd439","observation_id":"89b1ac81-2722-4701-964c-bc09b596c553","resolution":{"observed_at":"2026-08-07T13:20:17.242820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.291559Z","title":"conclusion","venue":null,"work_id":"9afa141c-ba97-4b96-9564-a7982cfb2a1d","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.367067Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:adf92032704d8265b19ed125643f963fb7eef416b4fb68fe0419617fb6dc6e41","observation_id":"92efe1ec-d154-4a5b-bb06-18470675cb3f","resolution":{"observed_at":"2026-08-07T13:20:18.406192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.467252Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.467252Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:064fb5bdbabb45577665a8a8e87040e5532f91a07efb2eebbcb0bd17f9c70d0e","observation_id":"db905805-387f-4bb5-8f29-99dfd5e8faa9","resolution":{"observed_at":"2026-08-07T13:20:17.467252Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.535059Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.535059Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:0cb2bfbffb0ee44ae531e3a64d684b200151f0a12c7f358182d250282a6131fe","observation_id":"12026156-5ed3-45a3-b32f-5f98b0d84f8e","resolution":{"observed_at":"2026-08-07T13:20:17.535059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.616522Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.616522Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:2dc2820eac61eff25a1f49c863fedd1895bddbb0a9336c0e718e204e1157bd95","observation_id":"cc4b721e-f123-4f09-ad8f-ed4e19d84568","resolution":{"observed_at":"2026-08-07T13:20:17.616522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.037561Z","title":null,"venue":null,"work_id":"e3ebad14-bcc2-42fa-8c1c-8f88003f550c","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.785500Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:055863fd2909bfef3495bf3ed184693c0d1ad2a11155f0dc192910b32848335b","observation_id":"a50eea92-b63e-4e4f-b570-1d26d36d623f","resolution":{"observed_at":"2026-08-07T13:20:18.118989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-07-06T15:58:27.523039Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-07T13:20:14.608540Z","title":"p\\\" and the cost of a jumbo eraser \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.608540Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:d9e4bab8f5e3a3fc43f68d48efd599b34afa125f8170a5da9940459a6f853eba","observation_id":"713c670a-8be1-4f03-a533-2e3109cfedac","resolution":{"observed_at":"2026-08-07T13:20:14.608540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T13:20:14.394659Z","title":"arXiv preprint arXiv:2412.21187","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.394659Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:ab41c33d0c8969a46b2341c137e865f01bfb235cc89b165b8bce970b07d3fa46","observation_id":"b00ac0cc-38c1-4948-b687-b6e90501a4a1","resolution":{"observed_at":"2026-08-07T13:20:14.394659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06514","last_updated":"2025-04-11T02:36:28Z","snapshot_observed_at":"2026-08-07T16:07:21.231398Z","submitted_at":"2025-04-09T01:25:27Z","title":"Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06514","snapshot_observed_at":"2026-08-07T13:20:14.455229Z","title":"Kehua Feng, Keyan Ding, Weijie Wang, Xiang Zhuang, Zeyuan Wang, Ming Qin, Yu Zhao, Jianhua Yao, Qiang Zhang, and Huajun Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.455229Z"},"links":{"cited_paper":"/paper/2504.06514","citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:b1efbd3dbd6b733819ccbddb61a52beaebb7893efc8563a2c16452b88895b0f8","observation_id":"9edd3401-5a7a-4679-a16e-ab99d28e7a5a","resolution":{"observed_at":"2026-08-07T13:20:14.455229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":21,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 10 inbound Pith citation observations for arXiv:2505.22113."}