{"as_of":"2026-08-04T20:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0bf7e7dbe862a9bb1936203f0cc02d12621e497c2a425397c3e4682cf4bd731a","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T13:09:01.611455Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23771/citation-record","integrity":"/paper/2607.23771/integrity","json":"/paper/2607.23771/citation-record.json","paper":"/paper/2607.23771"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.140351Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.140351Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:639edb11a9095f1ab8df32dfa8a22cbbcd9d88901ade988f820681837ec0420f","observation_id":"6c78d2e7-e099-4f19-8172-b1b0231f336c","resolution":{"observed_at":"2026-07-30T13:09:01.140351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15254","last_updated":"2025-06-10T21:52:15Z","snapshot_observed_at":"2026-07-06T19:20:37.430389Z","submitted_at":"2024-09-23T17:53:42Z","title":"Archon: An Architecture Search Framework for Inference-Time Techniques","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15254","snapshot_observed_at":"2026-07-30T13:09:01.315112Z","title":"arXiv preprint arXiv:2409.15254 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.315112Z"},"links":{"cited_paper":"/paper/2409.15254","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:1468ad370a9fd48e68960f6901e4b866bfd6462f9b2eb03fcdf6dcffaac71e9d","observation_id":"ca84f8fd-c60f-428b-904f-f3f75915a05d","resolution":{"observed_at":"2026-07-30T13:09:01.315112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.322126Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.322126Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:b1ba19186c338296062f29dd5434e3669e537be4432a44a55c0bc3ab0fe8fe00","observation_id":"7b93cefa-50e9-48a4-b98e-a0a6c280c32a","resolution":{"observed_at":"2026-07-30T13:09:01.322126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.329861Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.329861Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:4df25fd2fd1ed368e34dcff61e255cfddfd37f78edd4fd563b45b33eb56bb441","observation_id":"b5123d1d-8630-4702-a6f6-7991a5ca647d","resolution":{"observed_at":"2026-07-30T13:09:01.329861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-30T13:09:01.337196Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.337196Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:e4a8529449a01844754d688657488f6b10c8bbc0456e5bc3471f433b3a6b0052","observation_id":"3a19ecd9-eabf-40da-825e-a3e54afba3ac","resolution":{"observed_at":"2026-07-30T13:09:01.337196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.346978Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.346978Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:7ede3da7d2c09e9d57b69388f8837341c83658ac3899083480c59d9a46c45c70","observation_id":"1e738410-959f-4b10-8d74-431f0c3b483c","resolution":{"observed_at":"2026-07-30T13:09:01.346978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.360370Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.360370Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:02b375a24e3907e941176ccc040c9b5c27b259f6af528c8369aadb99b86c939e","observation_id":"c7f48261-a220-4f5c-9c2b-5383278f5d11","resolution":{"observed_at":"2026-07-30T13:09:01.360370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.365775Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.365775Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:9c4b7f14fabd8581c958504e9433a7bfc8db714153c8b330205b4e194640be84","observation_id":"20596af4-e8e8-4094-8d98-e778e0574280","resolution":{"observed_at":"2026-07-30T13:09:01.365775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06117","last_updated":"2024-03-12T04:38:27Z","snapshot_observed_at":"2026-07-06T16:30:08.320348Z","submitted_at":"2023-10-09T19:48:55Z","title":"Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06117","snapshot_observed_at":"2026-07-30T13:09:01.372470Z","title":"arXiv preprint arXiv:2310.06117 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.372470Z"},"links":{"cited_paper":"/paper/2310.06117","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:03f2241ce3dc5a38a4c0d58e26343515807e842d726bc4b1fe8247cc696569c8","observation_id":"4debd1c6-de6d-4732-8f2b-35f435005107","resolution":{"observed_at":"2026-07-30T13:09:01.372470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.378665Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.378665Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:59ade13063e4c12cebf21dbf91cd49886f2475c56f2903e990f1f9351ab5225c","observation_id":"94b5318e-ccc8-4604-a9cd-82c8a86ec17d","resolution":{"observed_at":"2026-07-30T13:09:01.378665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.388738Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.388738Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:4961a10fcb02ebafbe729f078bdeafa69548cce93da53e58b5484d20b61f1dd1","observation_id":"be22f277-4529-4844-83ea-270d04bc0b0a","resolution":{"observed_at":"2026-07-30T13:09:01.388738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.394540Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.394540Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:322edb126b8d0648c2723d695851e77e0469d94c79a3c682e695777661556fb7","observation_id":"b70bd16d-a3e8-419c-956f-3601aea614a4","resolution":{"observed_at":"2026-07-30T13:09:01.394540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.402002Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.402002Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:52de15e9572253292e584a9f5349d601abab57ee5556dce4283ab6d0c3182b5d","observation_id":"2660c7b4-92ae-498e-b3a6-fe0d8bc9df4b","resolution":{"observed_at":"2026-07-30T13:09:01.402002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.412757Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.412757Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:a6c84d5c87d546c95037971235cdb894123adcea779736de61832afff7ab3732","observation_id":"68d856c6-c55f-4b66-9448-2dd1df925d1e","resolution":{"observed_at":"2026-07-30T13:09:01.412757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.422394Z","title":"Proceedings of the 36th annual acm symposium on user interface software and technology , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.422394Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:c7549a224fcb1c83573f29d7340d93381ea0a338bbcae68af0d536e8fd64c4ac","observation_id":"14a34fbc-0f7c-49b1-9655-fe6319ec4eb1","resolution":{"observed_at":"2026-07-30T13:09:01.422394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.429179Z","title":"Frontiers of Computer Science , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.429179Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:87cbeca9d2ab8aeb0828d99573ca4a49e4b07b2143a0c3c536e7ddb63eb75fc6","observation_id":"6eb1e7a9-2c5e-46c7-80e3-e753fe283e30","resolution":{"observed_at":"2026-07-30T13:09:01.429179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.435895Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.435895Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:05d86624d5339538573c1bfa661af2d8bf947fc70811678d2fcd53a8d5e8b20b","observation_id":"f976b26c-9037-46d2-97e2-ef68fc8ab99f","resolution":{"observed_at":"2026-07-30T13:09:01.435895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-30T13:09:01.442871Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.442871Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:885207e9adbabbaa08b0923ebbf5cbf15bc3d48b090ded2b41494bd8c13aaf2f","observation_id":"9132fb83-fa0d-4019-ae13-4465faf03e7a","resolution":{"observed_at":"2026-07-30T13:09:01.442871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-30T13:09:01.449377Z","title":"arXiv preprint arXiv:2501.03262 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.449377Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:c1cb0cc365b22e468eff7f8913630e080e55e10dfd73fa660b101a11aad34fda","observation_id":"0c24fb04-ec27-4636-b78b-8b505f780e2a","resolution":{"observed_at":"2026-07-30T13:09:01.449377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-07-06T20:51:23.273195Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-30T13:09:01.454452Z","title":"arXiv preprint arXiv:2503.09501 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.454452Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:bff6919c60314aafeef3fea8ef9f69fa254e52e8ebd0fbdff25af8cb21188e01","observation_id":"cf496511-afe6-448c-aa03-daec8daf50ec","resolution":{"observed_at":"2026-07-30T13:09:01.454452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-30T13:09:01.459582Z","title":"arXiv preprint arXiv:2504.20073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.459582Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:fc329f41765181961e01d8f11495290d6d019000f420080f8b29c82291cb21a4","observation_id":"887ac30f-d76b-4c8e-b766-fa3ca5e62038","resolution":{"observed_at":"2026-07-30T13:09:01.459582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-04T14:33:36.204296Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-07-30T13:09:01.465751Z","title":"arXiv preprint arXiv:2410.09671 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.465751Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:6cd51c2b68ba2f264630350557a06215d2aa7e42d0ff62a877f50991411d105e","observation_id":"891041d3-db42-44b2-a955-5a82bae94216","resolution":{"observed_at":"2026-07-30T13:09:01.465751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.470761Z","title":"First Workshop on Multi-Turn Interactions in Large Language Models , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.470761Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:cd80fb13711baee18267b19c810a0fdadeb5f392bb92f2131c4482a34c19681a","observation_id":"cc7cb7c4-7700-4d6d-ad54-8c62657fdf0e","resolution":{"observed_at":"2026-07-30T13:09:01.470761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.475397Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.475397Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:03f6036b383eb2bf1d48557967287ecda5b8d29253886657d2105dad9cc98feb","observation_id":"17cc6985-5b85-4b56-b1be-bc751d865fb2","resolution":{"observed_at":"2026-07-30T13:09:01.475397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.480055Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.480055Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:ac97ac8113188ec90df7a2509e90f1b282e9983cb7ed0e32e530bb8e0e2a3e0e","observation_id":"c8881e43-04e8-491d-a9c1-28dfc9ebd689","resolution":{"observed_at":"2026-07-30T13:09:01.480055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.484477Z","title":"arXiv preprint arXiv:1707.0183 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.484477Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:60cce77177e0a868eb7be2658b14b86d1c371dc15bb74c7653efe14c803396e0","observation_id":"e5d95851-17fd-4f6a-9d1c-af4be63cb3ef","resolution":{"observed_at":"2026-07-30T13:09:01.484477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.489240Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.489240Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:214d0402e07c13b0370109f614cf245edd87a36466fbdb740a0cf99b7810b3a3","observation_id":"6fec7fbb-a568-4831-bd87-6f82d34b61f4","resolution":{"observed_at":"2026-07-30T13:09:01.489240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.493460Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.493460Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:a299968ad24335818016ec2586b84a23c513c90a8d56086e4a2de932478dec36","observation_id":"e5d41949-540d-499d-8815-43c2a54ee1f9","resolution":{"observed_at":"2026-07-30T13:09:01.493460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.497938Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.497938Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:899ecbfc5beec75735042190d3eb825bd0227b95b16de4fcb9c43aab31aac9cc","observation_id":"66d5b022-2b53-4c36-8ab8-490b05e51b79","resolution":{"observed_at":"2026-07-30T13:09:01.497938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.503033Z","title":"Machine Learning , volume =","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.503033Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:474a8f1ea22fb80e29628349dc4510839b6e9e700fce9bf0355a227ccf358f33","observation_id":"42656563-6928-4e1d-a1ef-e248da4500d3","resolution":{"observed_at":"2026-07-30T13:09:01.503033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.508598Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.508598Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:e5b625e39667d351715b66b4df26b12fa6bc0bfd57324158566002a2fe71d02b","observation_id":"cf1bd968-fa94-4ad5-9a3d-c23b2a840a57","resolution":{"observed_at":"2026-07-30T13:09:01.508598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.512924Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.512924Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:91c43e5f4d64c9253c4eadd7dd408058d4ec00a8b78497be8878b20d6d16474a","observation_id":"b1c610ad-18ec-4865-8024-9c44eb76b87a","resolution":{"observed_at":"2026-07-30T13:09:01.512924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.517473Z","title":"International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.517473Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:0f3199f9d82263ddb378e47f59e8b83bfa799a143034ea9931e50ee5c0fbbd1b","observation_id":"a78c7e02-9092-4f58-b351-577f590a141b","resolution":{"observed_at":"2026-07-30T13:09:01.517473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.524146Z","title":"International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.524146Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:f956cfe743290850c9a2b77ac13c57a3c23226e34661e9aeb54cb935e2d37dca","observation_id":"cac65229-2fb3-4917-81e1-388098665356","resolution":{"observed_at":"2026-07-30T13:09:01.524146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.531993Z","title":"2017 IEEE international conference on robotics and automation (ICRA) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.531993Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:ff19f947b92cbf47e28bd212fb191f0efabcaba82a20144e7a32e761cd27188a","observation_id":"941cdb94-fc70-4df3-bb49-4bcfeb870a0c","resolution":{"observed_at":"2026-07-30T13:09:01.531993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.539836Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.539836Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:675e603eb6a3ad4e86b0a7a02e4e69510e5b928241c35191544b8450da5edaf5","observation_id":"e2b06f8d-286b-4768-b22b-7e4663fd6beb","resolution":{"observed_at":"2026-07-30T13:09:01.539836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.545438Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.545438Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:1316efb2071dd2a60831707f1fa5b2e1d7344d85f32d38639deb7f4c011d12ac","observation_id":"1cec27f7-a7d7-4d98-97e6-fd63bf66dd58","resolution":{"observed_at":"2026-07-30T13:09:01.545438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.551057Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.551057Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:e6deed0574486be5d21df7c9662a78484b89f19e520f371fc5c8b4fb05232675","observation_id":"7c91183d-5383-41de-972e-d01c05f9adce","resolution":{"observed_at":"2026-07-30T13:09:01.551057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-30T13:09:01.571206Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.571206Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:f2b7f3b0a63f4c59bce5fcb40f45fdc0cde654bbcae5586d7c48306de10f69ac","observation_id":"07db6699-02c4-4e52-8028-774128613a01","resolution":{"observed_at":"2026-07-30T13:09:01.571206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-30T13:09:01.579004Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.579004Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:1176996e9ff6af7b1ad559491ff436b31a721febac94d3a50d9d30cf6b6aed64","observation_id":"82690ad4-d66d-438c-a4ea-726c517bac68","resolution":{"observed_at":"2026-07-30T13:09:01.579004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-30T13:09:01.584422Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.584422Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:1c5fb14b28ec587f37a3a3baa2908a2f9b8543c5512322f5f4c4cb8873eb001d","observation_id":"e451daaa-79de-436f-8b79-58ea83e3dcf3","resolution":{"observed_at":"2026-07-30T13:09:01.584422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.590286Z","title":"The twelfth international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.590286Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:789859c365c961e86ce291b6f664af4f720b7f5dec738d06293b1488eb76073a","observation_id":"02aa038c-b899-4fd5-a8f6-b89c730b4a6d","resolution":{"observed_at":"2026-07-30T13:09:01.590286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.601707Z","title":"2024 , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.601707Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:dccec3d84cc59b604c7ce2316fbefa067d798755db11c4c1acee0a077a332488","observation_id":"f8831cb2-63d6-43ef-9b71-890012c20cd7","resolution":{"observed_at":"2026-07-30T13:09:01.601707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.606330Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.606330Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:d97f0c38fd150cf6c614dd0a206b81ceb2cc20685dc27d2f2c25b8d606afcb4f","observation_id":"c3fb2c9f-a007-4c47-b90b-bf38db6d8961","resolution":{"observed_at":"2026-07-30T13:09:01.606330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.611455Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.611455Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:02c6c0971103be7a0c04d527f97bf134237e4b0a6604b5db84048cca80bf659e","observation_id":"87764391-feb3-4980-91b2-315e5cc4c3ad","resolution":{"observed_at":"2026-07-30T13:09:01.611455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-01T09:38:07.600897Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.23771."}