{"as_of":"2026-08-07T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dec315f71c1c0425c4cdd768e7adba613b4d233737ae63a0f3952db0a52a6afe","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:33:14.622826Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:46:47.158980Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:27:30.780707Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T23:17:02.701393Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2504.14945"},"observation_digest":"sha256:326339683068ff7952f70ecaa831797db7d13536cd75198e54fce299b948daa3","observation_id":"1e8854ce-8f38-4ae7-9e39-60f8befb076a","resolution":{"observed_at":"2026-05-15T23:17:02.898250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-06T19:46:47.158980Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04742","last_updated":"2025-07-08T02:54:20Z","snapshot_observed_at":"2026-08-06T19:38:10.863088Z","submitted_at":"2025-07-07T08:16:54Z","title":"Activation Steering for Chain-of-Thought Compression","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:47.158980Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.04742"},"observation_digest":"sha256:940e19afc6f0c6fb7fcc8432f0e831b1a7deca74e35dd168cbb6059fe9628fd2","observation_id":"cd451d3a-100f-4632-acb7-9f442874c142","resolution":{"observed_at":"2026-08-06T19:46:47.158980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-06T17:53:47.566505Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-07T01:15:50.475193Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:53:47.566505Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:524f4f7482c00030ca5529a08e82fa016bef565f7abd935d095dbd32d7a890ef","observation_id":"87a3f983-2e7c-44fb-b190-219dd66e7440","resolution":{"observed_at":"2026-08-06T17:53:47.566505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-06T12:23:55.086609Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21836","last_updated":"2025-07-29T14:12:28Z","snapshot_observed_at":"2026-08-07T20:39:44.012130Z","submitted_at":"2025-07-29T14:12:28Z","title":"AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T12:23:55.086609Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.21836"},"observation_digest":"sha256:91d402c449c98f36b7ca51188e6f66a999724cbc399e670ee20bd487cb2726e8","observation_id":"f4143950-2e76-456e-a840-66278d750e9e","resolution":{"observed_at":"2026-08-06T12:23:55.086609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:800ae6d562ac72e5900a401ad2e974be4b049e87c1bc4a84133aa83ace48ae3e","observation_id":"df7b24f1-6691-41a3-8471-0b59b258279a","resolution":{"observed_at":"2026-05-18T00:02:25.397403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2509.21743","last_updated":"2026-03-31T22:32:08Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T01:17:35Z","title":"Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T13:42:07.883909Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2509.21743"},"observation_digest":"sha256:8331a6fa541dd63081526ea9e083b4dcf36819b73f124735530643bab44e9a78","observation_id":"1244e1a4-09af-45f5-bc65-927153f45db9","resolution":{"observed_at":"2026-05-18T13:42:38.628885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-04T14:57:15.491600Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T14:24:48.666197Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:8f05c0dcf2729470d1ecefef3f64e52951638fe30b3eb5f62056804620f4c190","observation_id":"cd80a8e1-9df3-4476-a93e-309dba05edbc","resolution":{"observed_at":"2026-05-18T14:26:28.356258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-04T07:07:52.626304Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04694","last_updated":"2026-07-01T16:09:28Z","snapshot_observed_at":"2026-08-04T07:07:51.334462Z","submitted_at":"2025-10-30T22:13:31Z","title":"Reasoning Up the Instruction Ladder for Controllable Language Models","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T07:07:52.626304Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2511.04694"},"observation_digest":"sha256:c7b2bba9ed93517e50c604b62dca71301ad314e0c6702c064498c4df947fe9fc","observation_id":"5b236504-6262-4cd1-b48f-05ee07634c87","resolution":{"observed_at":"2026-08-04T07:07:52.626304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2602.21228","last_updated":"2026-04-20T12:48:23Z","snapshot_observed_at":"2026-08-02T12:14:20.654135Z","submitted_at":"2026-02-04T07:50:11Z","title":"ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:35.303413Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2602.21228"},"observation_digest":"sha256:92e21bcf236c5555be78cedec258f086b631222324b70f8fe9c6d3020754f459","observation_id":"035981a2-0272-45d4-abc0-f931a2a19ce8","resolution":{"observed_at":"2026-05-16T08:00:44.619454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2606.04160","last_updated":"2026-06-02T19:23:46Z","snapshot_observed_at":"2026-08-07T08:17:37.830144Z","submitted_at":"2026-06-02T19:23:46Z","title":"Expert-Aware Refusal Steering","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T10:04:13.562338Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2606.04160"},"observation_digest":"sha256:b44c7f696ea2130a54869006c58df21e0821d642fe602b360e8118bd12fcc0ef","observation_id":"5d43761b-0d0d-4906-a652-117b55d16885","resolution":{"observed_at":"2026-07-02T03:26:29.106120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2606.09662","last_updated":"2026-06-08T15:45:04Z","snapshot_observed_at":"2026-08-06T09:33:48.753803Z","submitted_at":"2026-06-08T15:45:04Z","title":"When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:33:59.661761Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2606.09662"},"observation_digest":"sha256:97accc45001d3340fc3dd5ea4ee621c1627130f358e033b10ab125bd68d2f77b","observation_id":"a5be2a59-61f1-4517-b01d-8da2e092dabe","resolution":{"observed_at":"2026-07-03T01:27:30.782222Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-14T12:08:05.502310Z","title":"arXiv preprint arXiv:2505.14810 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10386","last_updated":"2026-07-11T16:29:51Z","snapshot_observed_at":"2026-08-03T03:24:52.663992Z","submitted_at":"2026-07-11T16:29:51Z","title":"Structured Thoughts For Improved Reasoning And Context Pruning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-14T12:08:05.502310Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2607.10386"},"observation_digest":"sha256:12d0c402e41661b835338a5f44c32e50e84b78178f3c6e3fbcb99550d5ec43f8","observation_id":"f2244e3d-ae28-4746-96ff-a48ba458ff32","resolution":{"observed_at":"2026-07-14T12:08:05.502310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14810/citation-record","integrity":"/paper/2505.14810/integrity","json":"/paper/2505.14810/citation-record.json","paper":"/paper/2505.14810"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.157381Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond.arXiv preprint arXiv:2503.21614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.157381Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ccb8d27e79297ef21756c6b18501e14713f1f38ae3962e527ca6807b03a2fd5d","observation_id":"44568d9e-23c9-485f-8e98-0824b2d06ecf","resolution":{"observed_at":"2026-08-07T15:33:10.157381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:17.264477Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"b70291c9-f54e-48a7-bd23-c76072160918","year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.208482Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ee8e9f9fd2cfea303356ff9a54351127738945acafc517c15d9bf03577ae830e","observation_id":"65eaa0d6-7f87-479e-9758-3cc235820994","resolution":{"observed_at":"2026-08-07T15:33:17.316784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.246442Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.246442Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:31db064196220c1e74f9b916c16e6de7b28e7549707353c590bdd58ad3cd65d4","observation_id":"47a35041-50e0-4fdc-8ffb-97c75c48fe23","resolution":{"observed_at":"2026-08-07T15:33:10.246442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.307082Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.307082Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4eb463cbef10cf470f5d4eb172a287a13244403a2c5ffc9c231f2003cf6f0725","observation_id":"2c7a2c4f-99c9-4c9a-ae76-32bfbf88e23c","resolution":{"observed_at":"2026-08-07T15:33:10.307082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.370272Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.370272Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4a6ab74a18a2cf63621df3ee6064e8356b328f9ff44b54e87ad0c9ca69d9ee1f","observation_id":"5b26cc8b-3281-4877-8961-b99584ef6053","resolution":{"observed_at":"2026-08-07T15:33:10.370272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:33:10.452157Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.452157Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:e8e74e55be70f5619549f1f4aad85d086b3ee5dcd6387ccdb5626b0426018597","observation_id":"d9b5b964-b0ef-4d25-b0a2-003cf15c219e","resolution":{"observed_at":"2026-08-07T15:33:10.452157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.518270Z","title":"Aime problem set 1983-2024, 2023","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.518270Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:335f7938f0c1e82dae1ace7e2f768591489bf46dc980db04e7ae5e96cfa7bba7","observation_id":"7b153dfa-26f1-4809-be95-e2b9b1e63776","resolution":{"observed_at":"2026-08-07T15:33:10.518270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.568995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.568995Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ad3df0b79baddfa0f3d1a8b65817a6d2fad9e237dc823e7e7e338c32f51d5f1c","observation_id":"2dd24725-91cb-47cd-b3a2-efc412a34f00","resolution":{"observed_at":"2026-08-07T15:33:10.568995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.639989Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.639989Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4bcff9129663f6d6e41685a0e5a8fd9987e39bc64c82527aa0275e8241c543c7","observation_id":"18bd3729-b3b4-4c53-b40a-9fd402adf3d2","resolution":{"observed_at":"2026-08-07T15:33:10.639989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:17.014841Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains, 2025","venue":null,"work_id":"837f8f35-7e9c-4687-b171-558c7dc0e345","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.722778Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ca6e958dc1f7bead36637e5a2cb6b862ed458accf2982bb6be42a94589f3e213","observation_id":"242ded00-ce83-493d-b0a4-cd4920915107","resolution":{"observed_at":"2026-08-07T15:33:17.080686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.783973Z","title":"A survey on llm-as-a-judge, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.783973Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:d365d2fae8b291c1c01937d4a34fc8612157f2e53fedc84b13a7faf73aefc651","observation_id":"f6dd2e34-7add-447c-b744-8234be23c9b3","resolution":{"observed_at":"2026-08-07T15:33:10.783973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T15:33:10.861362Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.861362Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:9ea79be180af4be6c8a5c824615d596917c6c5e7d8a41cf8fee506d3b6adfec7","observation_id":"a33b4e24-dc98-45f0-a3e2-f428740bf069","resolution":{"observed_at":"2026-08-07T15:33:10.861362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20410","last_updated":"2024-06-05T15:39:26Z","snapshot_observed_at":"2026-07-06T16:41:07.373710Z","submitted_at":"2023-10-31T12:32:38Z","title":"FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20410","snapshot_observed_at":"2026-08-07T15:33:10.940404Z","title":"Followbench: A multi-level fine-grained constraints following benchmark for large language models.arXiv preprint arXiv:2310.20410, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.940404Z"},"links":{"cited_paper":"/paper/2310.20410","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:eb809748ae73a5c6f881703d822e540b39e23c50d43a3ecd9685af4534e6d46c","observation_id":"6e794753-fe77-449e-8d01-208d32f78d11","resolution":{"observed_at":"2026-08-07T15:33:10.940404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T15:33:10.981211Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.981211Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:447dd27a467a97547a955d285be6843650667f8ed9902c6c4b66a09ed2ef7ac7","observation_id":"5964b2cc-872b-4985-9287-f2872170f483","resolution":{"observed_at":"2026-08-07T15:33:10.981211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.057906Z","title":"Limo: Less is more for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.057906Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:66ca7ce9c107b479ce514a097a2cd626d1d87dabdfd63475ac4ff080c9baa8c6","observation_id":"bb7d4fd3-53a1-4468-a2f1-8d85f9fd58e9","resolution":{"observed_at":"2026-08-07T15:33:11.057906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.148146Z","title":"Demystifying long chain-of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.148146Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:7b7d74f257d999f94343f8567b6ecbc922f778a911682590dc1ca31aabbdf631","observation_id":"d988746a-3274-4130-af2b-b319f12ac6f4","resolution":{"observed_at":"2026-08-07T15:33:11.148146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.225305Z","title":"SFT memorizes, RL generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.225305Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:a6455169b7a11cbd8850125ed0c2f2a8fa4ce1eec0786e7b8ea6d69224b7c18a","observation_id":"27eceab6-b648-490e-8d28-ce69017e3b3d","resolution":{"observed_at":"2026-08-07T15:33:11.225305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.311589Z","title":"There may not be aha moment in r1-zero-like training — a pilot study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.311589Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:1efcc5ca18bca620ae396fc8fb8fb5c6f0388767d1b38c293f1402446dc9ba16","observation_id":"f344a563-8832-4594-b617-c98677f4577a","resolution":{"observed_at":"2026-08-07T15:33:11.311589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:33:11.407955Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.407955Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:7706df3a94c04a7e915d272e9165fd05f4e74896c6782fd73560ab7c4692e8f3","observation_id":"a25740f0-4537-4d6f-8f54-d60862085901","resolution":{"observed_at":"2026-08-07T15:33:11.407955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T15:33:11.486382Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.486382Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:f11169c45206caf0cb223effc5f0ec2fa3ffb61a29dde3c998f2283c19f98ab0","observation_id":"4d772c21-66fd-496d-8fcd-fbe6ccde9a3d","resolution":{"observed_at":"2026-08-07T15:33:11.486382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.560154Z","title":"Learning to reason under off-policy guidance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.560154Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:9f5f79d91cb951d088b9e034a2c6c604ca7f18f41b9f7a602b530cc0fdb69bbe","observation_id":"92ce5b9b-bf31-467e-aafe-b599b15e1fdb","resolution":{"observed_at":"2026-08-07T15:33:11.560154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13173","last_updated":"2025-02-17T19:56:21Z","snapshot_observed_at":"2026-08-07T18:11:02.754125Z","submitted_at":"2025-02-17T19:56:21Z","title":"Thinking Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13173","snapshot_observed_at":"2026-08-07T15:33:11.638080Z","title":"Thinking preference optimization.arXiv preprint arXiv:2502.13173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.638080Z"},"links":{"cited_paper":"/paper/2502.13173","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:5682106200245516183d3eb1902445b0fb5e56856befc572e6a91d51ab74852a","observation_id":"de45736f-69f1-464f-8f18-338b7dba298d","resolution":{"observed_at":"2026-08-07T15:33:11.638080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.738840Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.738840Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ca330b040ab6905ac073802f4fa7893aebd29f9579f194c9af71a996f3a1e090","observation_id":"0162cf0f-ef5e-40e7-bfb3-9c06587da67c","resolution":{"observed_at":"2026-08-07T15:33:11.738840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.809584Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.809584Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4e217000c7edf2e1d0f0863224d71e6d06924da3eda07948694feb5aecee85a8","observation_id":"a56b2ab7-afc0-4d9c-8d4e-716add35b17c","resolution":{"observed_at":"2026-08-07T15:33:11.809584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.728796Z","title":"FOFO: A benchmark to evaluate LLMs’ format-following capability","venue":null,"work_id":"b098f4d2-5d00-4799-a15f-ab46fc2ba80b","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.922967Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:8c25aac7a21dd5812ad00755269fa622246927c2693c851064a0a4f46170f9be","observation_id":"dd55063f-3abd-499a-95a8-4b6a268df8c6","resolution":{"observed_at":"2026-08-07T15:33:16.800930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.542175Z","title":null,"venue":null,"work_id":"fa49db34-3edb-4e6c-a378-8ca2c42461a9","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.043697Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:6e95ab51186ae22518b49354315442534ffa34ac999ca13f6b84a781b3ae0a0e","observation_id":"e94cee61-4939-4de0-b284-97e4471d10c5","resolution":{"observed_at":"2026-08-07T15:33:16.608320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15553","last_updated":"2024-11-13T04:26:13Z","snapshot_observed_at":"2026-07-06T19:36:45.701678Z","submitted_at":"2024-10-21T00:59:47Z","title":"Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15553","snapshot_observed_at":"2026-08-07T15:33:12.154089Z","title":"Multi-if: Benchmarking llms on multi-turn and multilingual instructions following.arXiv preprint arXiv:2410.15553, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.154089Z"},"links":{"cited_paper":"/paper/2410.15553","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:9bd390bd0284515531929973e07bb1b5b6340dffb2cd22290732fe423daeb9a7","observation_id":"8bb70e02-d4e0-48a9-bcff-a8cc018a5b53","resolution":{"observed_at":"2026-08-07T15:33:12.154089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14494","last_updated":"2025-05-30T04:20:31Z","snapshot_observed_at":"2026-08-07T18:02:12.486572Z","submitted_at":"2025-02-20T12:22:18Z","title":"StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14494","snapshot_observed_at":"2026-08-07T15:33:12.228882Z","title":"Structflowbench: A structured flow benchmark for multi-turn instruction following.arXiv preprint arXiv:2502.14494, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.228882Z"},"links":{"cited_paper":"/paper/2502.14494","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:feb7fbf08a3768b7a8dcf33ebe1bcc85f9c71e2dee58b7a72796f07bd14b1998","observation_id":"17fbfcef-6d59-4686-aad8-7d66ebad32a5","resolution":{"observed_at":"2026-08-07T15:33:12.228882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:12.305782Z","title":"Can language models follow multiple turns of entangled instructions?arXiv preprint arXiv:2503.13222, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.305782Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4b914d2b7b53a9de4cf19b7dd8d875d62f5e904bb12f9719b9b23f1af1672579","observation_id":"022c8737-095b-40c0-96c4-b31b2ec9154c","resolution":{"observed_at":"2026-08-07T15:33:12.305782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17399","last_updated":"2025-03-06T04:41:56Z","snapshot_observed_at":"2026-08-05T22:39:31.964846Z","submitted_at":"2025-01-29T03:29:24Z","title":"MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17399","snapshot_observed_at":"2026-08-07T15:33:12.420401Z","title":"Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier llms.arXiv preprint arXiv:2501.17399, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.420401Z"},"links":{"cited_paper":"/paper/2501.17399","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:11546a24f4117d39335bbcacd8ade4a2a18d8b94bd50750b29aa8695767f7c9e","observation_id":"6e46e7b3-0481-483d-8932-7b2ab6cebf05","resolution":{"observed_at":"2026-08-07T15:33:12.420401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07037","last_updated":"2025-07-23T22:08:05Z","snapshot_observed_at":"2026-08-07T09:03:10.840603Z","submitted_at":"2024-11-11T14:43:51Z","title":"LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07037","snapshot_observed_at":"2026-08-07T15:33:12.524178Z","title":"Lifbench: Evaluating the instruction following performance and stability of large language models in long-context scenarios.arXiv preprint arXiv:2411.07037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.524178Z"},"links":{"cited_paper":"/paper/2411.07037","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:e55049cc3330162a66ccbade5ff71b951cbca5197eec8851edc1781f4535092b","observation_id":"28e29008-b9b2-4a36-879c-89128bc6f3d3","resolution":{"observed_at":"2026-08-07T15:33:12.524178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:12.608031Z","title":"Xifbench: Evaluating large language models on multilingual instruction following","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.608031Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:953679cdf0797017fc75da054c686256d0cc5b8ca3e647f5aca949e72e7938cc","observation_id":"41151d93-1676-4dfb-97cf-ecc2cea02dcc","resolution":{"observed_at":"2026-08-07T15:33:12.608031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.366994Z","title":"IHEval: Evaluating language models on following the instruction hierarchy","venue":null,"work_id":"a03401fe-1bbc-4c06-93ed-98f6bc29c92e","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.671400Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4c6b745ffa80a04c65583485a023e81dc45c839d20f879eedece5fa36667c0f4","observation_id":"cbd99d66-e41f-4dc3-ac5d-80aa18f35783","resolution":{"observed_at":"2026-08-07T15:33:16.432287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.187155Z","title":"Chain-of-instructions: Compositional instruction tuning on large language models","venue":null,"work_id":"c418f530-fba4-4274-95b9-1b6bb4b123f3","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.869124Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:11628dfaa373bdffdd5364635bf14652c481e8aa29bc97d9dd68b29ef351f071","observation_id":"53abe998-55b1-4760-922b-e120406ac5de","resolution":{"observed_at":"2026-08-07T15:33:16.265814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.023175Z","title":"RefuteBench: Evaluating refuting instruction-following for large language models","venue":null,"work_id":"85f57eac-ff8b-4f05-a0b2-0e1bd570e5ba","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.970356Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:b25fd6cfdc0bd14db5805d164f72e1850dd75f6ab23dd475a5f7e27d12f046ce","observation_id":"53656fb6-10c5-43f2-b5c3-cdc3f7ae0f64","resolution":{"observed_at":"2026-08-07T15:33:16.093504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:15.856890Z","title":"Refutebench 2.0 – agentic benchmark for dynamic evaluation of llm responses to refutation instruction, 2025","venue":null,"work_id":"09419323-9fc8-4136-8804-cf85ba9ea34a","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.063240Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:7c4db74b376d6cc0b8517fc11fe3f76ac7541034505713144162d3b01a55aa43","observation_id":"a81c3877-1496-43b9-8e72-46959fe21fe1","resolution":{"observed_at":"2026-08-07T15:33:15.938425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.132176Z","title":"Benchmarking complex instruction-following with multiple constraints composition.Advances in Neural Information Processing Systems, 37:137610– 137645, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.132176Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:5ebf7e5fbe4965f8c979daef384976ea527fd18dd0ce117558a455385d8c576e","observation_id":"1dc49d07-536f-49d5-af35-f5ed750fec17","resolution":{"observed_at":"2026-08-07T15:33:13.132176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:33:13.201382Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.201382Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:a2827bfca14e3f9412f53d78484ca2b42ad67d17030e484aa7e8e21a4ec4713a","observation_id":"c15a7049-461a-4614-9ebf-2a802448278b","resolution":{"observed_at":"2026-08-07T15:33:13.201382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:33:13.276979Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.276979Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:db2899a0ec67e11265428ecba363363d83fa694492f33ebf39eb9831ea9d6404","observation_id":"10907a57-b443-4eff-8db6-2aa6a0c68a11","resolution":{"observed_at":"2026-08-07T15:33:13.276979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:15.682638Z","title":"Minerva: Accelerating data analysis in next-generation ssds","venue":null,"work_id":"ba1ff5db-45df-47f7-bb01-b577ef159748","year":2013},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.341352Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:e296d5a0255d0643e4871ef5c4da1dbdc95521dc1dc7b27a7c171d3dbf13899a","observation_id":"e3db8243-d059-40b1-8ece-eb9e9b71d518","resolution":{"observed_at":"2026-08-07T15:33:15.745229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.429582Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.429582Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:208a456dfb76738899440942c59436e708883f7d2cf0711cbbf6b7acdd0b4958","observation_id":"81bdc687-70e6-4f71-af8d-29c061b47e1a","resolution":{"observed_at":"2026-08-07T15:33:13.429582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.532662Z","title":"Qwen3, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.532662Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:23f27cf655f781ae128904cdd932a8ffa1b4fa43bd8d1eadab42c472ff6a8af6","observation_id":"11a41faa-a906-4367-b22e-7db1df5f14e5","resolution":{"observed_at":"2026-08-07T15:33:13.532662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T15:33:13.621188Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.621188Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ce2851ee0f6caf4561cae9a61ac66d4ce2cb4da07885789fea68b8b86d21da0f","observation_id":"55f2cf9e-82ae-4bbc-9a03-aa64511f35d8","resolution":{"observed_at":"2026-08-07T15:33:13.621188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:33:13.735556Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.735556Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:5d34be2a617e19baa73df2b4e69224476fee8b43e765a8c2c0c8101ef7ece86d","observation_id":"79fa9c6b-3bd0-4099-9b08-824846a7d1f1","resolution":{"observed_at":"2026-08-07T15:33:13.735556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.835666Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.835666Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ce205c37cce29bc53379d28f87c16e3394447f816547f106131a0afa8eea5242","observation_id":"f49f2bd5-2c6d-4f20-8d8d-a2dddf292488","resolution":{"observed_at":"2026-08-07T15:33:13.835666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T15:33:13.910728Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.910728Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ba2bcf2f3254ca582a6694dbecc5e844406d76843870a44b0a99243f140a5ca2","observation_id":"dcec4b4d-7758-4c3d-9930-0c4c215f67e4","resolution":{"observed_at":"2026-08-07T15:33:13.910728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T15:33:14.005401Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.005401Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4f1e9b4cd43a9e8659c16955259bd1adc4ad49f0806bfcc992c87e5f8dd4271c","observation_id":"0cac9504-c05f-4349-a0ec-c1b24cc81c41","resolution":{"observed_at":"2026-08-07T15:33:14.005401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.083554Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.083554Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:ea144b8396b1a898ddd5039b7d398cb8777e3b65e407c0ab0a3f0e95d322f138","observation_id":"d6dc24a3-efa5-479b-adbe-fac5ed3701fe","resolution":{"observed_at":"2026-08-07T15:33:14.083554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.221930Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.221930Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:730f255d1a1b01c9a2342b8407b725e232b6ff106bb19b1fc897a90e9625cda4","observation_id":"f43c058a-ad96-4a97-8379-471d5590d1fc","resolution":{"observed_at":"2026-08-07T15:33:14.221930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.341149Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.341149Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:a536081655e221b04af07b28bf90154e04289d43fb74371b06a34462a6079d46","observation_id":"79f0a2f6-98d9-45a0-ac80-fb90fb618d74","resolution":{"observed_at":"2026-08-07T15:33:14.341149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.438481Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.438481Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:9228e45ddad86ebde96d521546b344f8a23c65f66406166c901ea46f30ea35d4","observation_id":"c73eeb6f-0dd0-42b2-85bc-58f3076f5df9","resolution":{"observed_at":"2026-08-07T15:33:14.438481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:33:14.543415Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.543415Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:86091b5f8b46ace172dc33f6b92c769d037ea88a9e3f39251fdded9c0dd0e194","observation_id":"2bd12cc8-133b-4fd6-8560-9ffb777bc94e","resolution":{"observed_at":"2026-08-07T15:33:14.543415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:15.407358Z","title":"The impact of reasoning step length on large language models","venue":null,"work_id":"2c6c2aed-8c29-4a81-aeca-dc8acb194d9e","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.622826Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:dbbd2c1ab16e224b33aa877a9fe0b89d712e58c5b178556c82f82d7a1557c530","observation_id":"ebf27aa1-fe25-4327-a976-0eac331754cd","resolution":{"observed_at":"2026-08-07T15:33:15.469178Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:12.796349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.796349Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:459e13e469bceddd95893e3f2bdbcf051220fedf2603f8d49b5a65e35bf5c94d","observation_id":"2ff083fc-448b-4229-a8eb-0199ed4cec8c","resolution":{"observed_at":"2026-08-07T15:33:12.796349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:27:03.992813Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 12 inbound Pith citation observations for arXiv:2505.14810."}