{"as_of":"2026-08-07T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bacfe9bc23639645c8b918dab0960ca986cb79e44c1161f7b914edf5f8f56828","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:32:24.383801Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23153/citation-record","integrity":"/paper/2607.23153/integrity","json":"/paper/2607.23153/citation-record.json","paper":"/paper/2607.23153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.145593Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.145593Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:9b49f6ccedd11252b5cb969238f48c95542270f56178b1fb8e5ef14d85a500dd","observation_id":"5033dc2a-7c41-4b21-bfb1-a41edc07e80f","resolution":{"observed_at":"2026-08-01T03:32:24.145593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.152289Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.152289Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:227fb80334b403b4c9cd407d428b1e71a550c42942d4eef919e1df5c2a068540","observation_id":"3b04400d-0cf7-42c5-b304-b66e84f3aeaa","resolution":{"observed_at":"2026-08-01T03:32:24.152289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.157301Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.157301Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:21d74163a7cea840a74708ded0fc29a8bfb2612c4b605de3238a89ac7921a6d9","observation_id":"6da39227-a068-4dc8-922e-393712d7ec0e","resolution":{"observed_at":"2026-08-01T03:32:24.157301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-01T03:32:24.162820Z","title":"arXiv preprint arXiv:2309.03409 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.162820Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:2f6877469c552554fae7f24ea189354067c4dc01868c778c093615ed75a94a17","observation_id":"f4f272ef-77fd-4193-b2bc-0c627450b6a0","resolution":{"observed_at":"2026-08-01T03:32:24.162820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.168207Z","title":"Findings of the Association for Computational Linguistics: ACL 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.168207Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:4a6f70583e574862c71d524f884070c9a3535bc24664fb732706d9d89d4bcd2d","observation_id":"36fe7e6e-dbee-4fb7-a77c-98bed0a65d6e","resolution":{"observed_at":"2026-08-01T03:32:24.168207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.172884Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.172884Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:a8032d5b3572b825fedb67a618f4d69bf0f73b6c9605c8c60fa2c2bc66c8fecc","observation_id":"8b735784-7495-4890-9dcf-f9fdc8c3ce48","resolution":{"observed_at":"2026-08-01T03:32:24.172884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.177857Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.177857Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:d895e62856f12f32d3a83eeca03b936d77eb2747c8febaad4f6458f42c31af20","observation_id":"202835aa-0c13-4d4e-ad2c-1b915909362f","resolution":{"observed_at":"2026-08-01T03:32:24.177857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.183464Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.183464Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:e0e70c2d3940340b08f332f3eb5f7948ae78b6d6f0f5676f9d362eccf7ff56a5","observation_id":"3f72c1b8-abff-4bce-9bd7-dd874486f9f5","resolution":{"observed_at":"2026-08-01T03:32:24.183464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.188567Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.188567Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:0e35df773578d20b0c4af1bcff24f120ea548e5173d7cd3bf938168bdc87a6dc","observation_id":"9a8584b1-8675-475e-82af-d065057cb640","resolution":{"observed_at":"2026-08-01T03:32:24.188567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-01T03:32:24.193341Z","title":"arXiv preprint arXiv:2209.11895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.193341Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:ed594942f09c6527b3d81cb273961fe3e077cd9315234359162cfd1e8b24d0b0","observation_id":"83fcc5f2-4629-4a53-a95d-ca611f35ea69","resolution":{"observed_at":"2026-08-01T03:32:24.193341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.198200Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.198200Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:d97c7d47881f8096eb6bc4aec917f1660178915e9afdc2dc8445189825a65cd8","observation_id":"f1032574-869d-4cae-9ad4-c77cbf3668c8","resolution":{"observed_at":"2026-08-01T03:32:24.198200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.202731Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.202731Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:4f729b30e7d4d0ed927dea28e148236c2b436e832c62d29f8f5d24506f10f77a","observation_id":"2d81438d-1dfb-466b-8601-64ccbed63264","resolution":{"observed_at":"2026-08-01T03:32:24.202731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.207556Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.207556Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:8964a73dfb0fade91363e6db906e9931ae316c927d6deedc8e552fb1b5b53221","observation_id":"725d43e2-a0dd-469a-a5fa-e052fa326dfc","resolution":{"observed_at":"2026-08-01T03:32:24.207556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.212560Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.212560Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:304612de9b3e443ea66f312ae76deeac52bcd767709f6e7e2c00d4ed64c974a6","observation_id":"a1bb02dd-2614-4e7b-81e8-90b976f618f8","resolution":{"observed_at":"2026-08-01T03:32:24.212560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.217332Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.217332Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:c59d745a876a41a93aa7da5ead2f841f95a29e1798150eab17749d0b1304aa34","observation_id":"f8a94a0f-a5fa-48d2-90ad-2f26252e6d29","resolution":{"observed_at":"2026-08-01T03:32:24.217332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T03:32:24.222698Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.222698Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:60ec5936b6b64517126ad0e85a5e6031fd4feef049bd9b9b0d357a57684dadc4","observation_id":"405a149d-67e1-422b-853c-6dfe8619358e","resolution":{"observed_at":"2026-08-01T03:32:24.222698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.228317Z","title":"2025 , month=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.228317Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:682f7b14feb8839f2c2d8d95af530d03dc5a7401b377e08091d173a48e1a828b","observation_id":"32f46e90-0747-489c-bd00-bd240c34fe4e","resolution":{"observed_at":"2026-08-01T03:32:24.228317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-01T03:32:24.233779Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.233779Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:04523714b1ed4d8b97702e5bb686704da19f7833478f3faf706a0cca5d91a545","observation_id":"1af7114e-c0e4-4557-be3d-c5e0b9d651db","resolution":{"observed_at":"2026-08-01T03:32:24.233779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T03:32:24.238826Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.238826Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:18493764fef6b31534e59262854492ec91c654a041265231e43e8870c9c1ebc4","observation_id":"55291bae-0ea5-428f-b6c1-8baa1a951b10","resolution":{"observed_at":"2026-08-01T03:32:24.238826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.244739Z","title":"Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.244739Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:db413d4e0d8d4a9521bbca80e77ceee9289593411662f21c5627862debf9bc93","observation_id":"09aa6a92-592f-432b-b5de-1d94360bc237","resolution":{"observed_at":"2026-08-01T03:32:24.244739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.249935Z","title":"Dissecting Recall of Factual Associations in Auto-Regressive Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.249935Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:59e6a8cacde5a380d4ca2086b48aadf1cf2ab1473478d73da1da62488048c918","observation_id":"c4e311bc-2f0a-46ba-96b9-18213219def8","resolution":{"observed_at":"2026-08-01T03:32:24.249935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.255551Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.255551Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:4feb1d0faccd0a7fa6ac456fb36ad62935b3601dbab119c583e7f4061120f3cb","observation_id":"6c8d8249-20cc-4ad0-bcf0-744a03cc3632","resolution":{"observed_at":"2026-08-01T03:32:24.255551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.260605Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.260605Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:6d8308df7c9e602f231f2bfe5352cb50197f14f8d743d88adfdca4a63a2d30b8","observation_id":"7104a18a-cfc7-4ef1-8703-ccbef8eadee7","resolution":{"observed_at":"2026-08-01T03:32:24.260605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-01T03:32:24.264936Z","title":"arXiv preprint arXiv:2512.13961 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.264936Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:7507f006eb2005b07d0bda117685ed1d3674e26917e4143a6510a70c59f66877","observation_id":"e1a8e865-1f52-4a46-9308-7023386108c2","resolution":{"observed_at":"2026-08-01T03:32:24.264936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.269825Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.269825Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:d68d84812f7f52602e045453dc04a3b572b208127c3cb41169dca86f7b83fdbd","observation_id":"49728a35-695d-496f-9fc5-1466779576cc","resolution":{"observed_at":"2026-08-01T03:32:24.269825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.274382Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.274382Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:8d79893e3dfbc3b231e59fdadab3c06d538d5e4eeeec5783bcafb2ed50695bb1","observation_id":"8158f2cf-9993-4511-9051-036f16d233c8","resolution":{"observed_at":"2026-08-01T03:32:24.274382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-01T03:32:24.279757Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.279757Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:0ec837ba5590930007d1aac36ef904088bfb0cc39b24560d19f47dc6db387a96","observation_id":"9d99406b-c498-4949-beca-47d058c0aac5","resolution":{"observed_at":"2026-08-01T03:32:24.279757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T03:32:24.285115Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.285115Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:3fb8650ddf4a102c8e89aed1482029ddcd8320d49c90861e6978a4253055cfbc","observation_id":"79b704e0-73fa-4128-9e00-11b8d075ee4d","resolution":{"observed_at":"2026-08-01T03:32:24.285115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.291842Z","title":"DROP : A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.291842Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:2e3322defb7a8f546103e4d0bc1e12383c374ab4770c7da40459cee648ec6c5f","observation_id":"48fc6866-17ec-46fb-9948-4daa26ea4602","resolution":{"observed_at":"2026-08-01T03:32:24.291842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.297221Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.297221Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:419443031b17c097304b031bd0f405d199856acd53c7afe6452e78973a98f507","observation_id":"0cea5548-3399-4279-b710-89631107ce0e","resolution":{"observed_at":"2026-08-01T03:32:24.297221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26519","last_updated":"2026-04-15T11:36:27Z","snapshot_observed_at":"2026-08-03T20:46:59.235928Z","submitted_at":"2025-10-30T14:14:15Z","title":"Think Outside the Policy: In-Context Steered Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26519","snapshot_observed_at":"2026-08-01T03:32:24.302286Z","title":"arXiv preprint arXiv:2510.26519 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.302286Z"},"links":{"cited_paper":"/paper/2510.26519","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:6fe56e4ecdbd5c43d2877c362ac5da0eeec3f404406afa5ccfe661d5aa9f6168","observation_id":"f16e94fc-e17e-4562-8b6c-c1ca32efcb07","resolution":{"observed_at":"2026-08-01T03:32:24.302286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.307229Z","title":"Sampling-based Pseudo-Likelihood for Membership Inference Attacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.307229Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:68969fe9e0a70d7e33080a2373a6e39353a09891fc94c04f2cba83d8f0385dfa","observation_id":"a180430d-b52b-437c-ad62-b77fef06a1bf","resolution":{"observed_at":"2026-08-01T03:32:24.307229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.311803Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.311803Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:59a5358de10dec10b06ed5689db7bd806e7182581fdff9201c6f408d032492c7","observation_id":"78fceb19-54cb-4b28-a7db-a7b7cf3ffb6c","resolution":{"observed_at":"2026-08-01T03:32:24.311803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.317246Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.317246Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:152ceb555797324a4a7790a82f2a56045723f7767bd70b9582ee28717a803adf","observation_id":"6c072540-6ae8-43ba-b8ce-eed402c33c25","resolution":{"observed_at":"2026-08-01T03:32:24.317246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.321701Z","title":"arXiv preprint arXiv:2410.05362 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.321701Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:111306519c5f30fa31a4126cc68980281384f772b7d87b3495f580b4581ed19c","observation_id":"31c19998-ce13-4563-ada0-1b66fce1514d","resolution":{"observed_at":"2026-08-01T03:32:24.321701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.326578Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.326578Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:d72d3ad769922098bbeaa901ef72c7c8e5fd81a6bafe2c76a69f52864ade439a","observation_id":"af40d2c9-bf3e-4225-bb26-51f576d838c9","resolution":{"observed_at":"2026-08-01T03:32:24.326578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.331401Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.331401Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:a12f7e3629b9e97322f3405112fa39fb0a4163a8ac1e40a5ec03f5497a5e4d92","observation_id":"9086b9e9-18de-4924-aacf-47a16b72ceb1","resolution":{"observed_at":"2026-08-01T03:32:24.331401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.ijcnlp-long.140","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization","venue":null,"work_id":"9667ac60-7515-4d70-a731-65ba984e238b","year":2025},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.336474Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:6c18ab0ccdd2947d964d345876d24824cdc3e4ea664a55cccf9e78d67c0efe50","observation_id":"4b9fba77-ec17-48d7-94aa-a41df64141f9","resolution":{"observed_at":"2026-08-01T03:34:05.146592Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.341314Z","title":"arXiv preprint arXiv:2601.06884 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.341314Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:0c33a835f06f812b4b6938d15ba37c4e6fb5022bf74d6688029b25b1c3f5258c","observation_id":"21ba238a-dcb3-4405-81a6-75a643ccf4df","resolution":{"observed_at":"2026-08-01T03:32:24.341314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.347218Z","title":"RLP rompt: Optimizing Discrete Text Prompts with Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.347218Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:eaf0ba21e110bbdd5bf939f115289aa9b8fb562897eedd12401838ebde899165","observation_id":"f5737e52-8d78-4006-a1d1-f7470c72ab4a","resolution":{"observed_at":"2026-08-01T03:32:24.347218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11890","last_updated":"2022-11-21T22:38:20Z","snapshot_observed_at":"2026-08-05T12:26:13.585918Z","submitted_at":"2022-11-21T22:38:20Z","title":"TEMPERA: Test-Time Prompting via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11890","snapshot_observed_at":"2026-08-01T03:32:24.352368Z","title":"arXiv preprint arXiv:2211.11890 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.352368Z"},"links":{"cited_paper":"/paper/2211.11890","citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:d3a9e0d1d3730d04a44ed09d8ce2cd0738896af8ec37271e0f06395c371a3f8d","observation_id":"67f41f14-4a98-4b62-b9c0-c45daf1baf41","resolution":{"observed_at":"2026-08-01T03:32:24.352368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.357810Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.357810Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:a9646f48bc8de546b99ea6bb26aa413bf6b0337860c4e3c5691a18f1cf2a2240","observation_id":"69ce3b4a-81ba-494b-9d7b-32f2a120318c","resolution":{"observed_at":"2026-08-01T03:32:24.357810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.362786Z","title":"2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.362786Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:a6d30f6f900e6a9a21acd99486ad187ed4d18abb517cc1b380e17ec95f196ef3","observation_id":"f5de7818-0b14-4f61-9385-f104a69f5966","resolution":{"observed_at":"2026-08-01T03:32:24.362786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.367909Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.367909Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:ebe0f6982a006e1ea7275464ccda37f0add16215e49631af6ac283f35a2816ca","observation_id":"5782760c-9aba-4dde-8f7c-036797e72914","resolution":{"observed_at":"2026-08-01T03:32:24.367909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.373654Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.373654Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:421e0247bac1034f85a0cb5a4c491caca0f7fe184d0a92a9dba39dea62d6e570","observation_id":"ce8b9c8c-ff4b-40b7-a6fb-5ce1fb71ab7e","resolution":{"observed_at":"2026-08-01T03:32:24.373654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.378910Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.378910Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:3f9b461fede09f3cc9f2d2222403795ba9f73cc9dc8d7d8942edfacb9694881c","observation_id":"d281de99-ac6e-4a72-99a1-8c1c266a321c","resolution":{"observed_at":"2026-08-01T03:32:24.378910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:32:24.383801Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T03:32:24.383801Z"},"links":{"citing_paper":"/paper/2607.23153"},"observation_digest":"sha256:34d9fd3aa5aae4e0a6400ae8b7461b099148d9274c21f532946872a8233cdb8f","observation_id":"90f3d2ce-4667-4f59-8109-5be21015de5d","resolution":{"observed_at":"2026-08-01T03:32:24.383801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23153","last_updated":"2026-07-25T11:13:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T22:08:05.020873Z","submitted_at":"2026-07-25T11:13:52Z","title":"In-Context Learning as Implicit Policy Gradient"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2607.23153."}