{"as_of":"2026-08-16T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f03a31a8bdae4c868d1e590e9c2a2a68b12e10d59c423bfd29be6bf9bccb4b98","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:16:21.881919Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18532/citation-record","integrity":"/paper/2607.18532/integrity","json":"/paper/2607.18532/citation-record.json","paper":"/paper/2607.18532"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:13.575026Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:13.575026Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:d9e57b7ccc094b920700880a4a052b19cea60fdff784d9caa7b4a477aaca4243","observation_id":"33a8c4d3-bf7e-42a6-b333-a605efb0fb5e","resolution":{"observed_at":"2026-08-01T15:16:13.575026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:13.663724Z","title":"ICML 2025 Workshop on Reliable and Responsible Foundation Models , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:13.663724Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:2b98c1b32d987257873d2eb12971d50f2fbe7827452bdcad7d94a41985565cea","observation_id":"0237123c-6c4a-4e5f-adee-38562c24232e","resolution":{"observed_at":"2026-08-01T15:16:13.663724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:13.791427Z","title":"Proceedings of the 41st International Conference on Machine Learning , articleno =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:13.791427Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:50e2d4c968e6035d6307266c57b9b615bbc2f3574cb603bae53134159a54ce92","observation_id":"cba94a23-644f-4f6c-9b5f-3a7de9259228","resolution":{"observed_at":"2026-08-01T15:16:13.791427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.005522Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.005522Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:f2908dad77bb88c961767dabecb8f6446bc98009038904b5602b297d279d6751","observation_id":"825cca83-bfc2-474e-8259-d4b1cd4b9007","resolution":{"observed_at":"2026-08-01T15:16:14.005522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.134693Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.134693Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:bb63522184ba7ab6ecb65e7382981910da9b058c9e43d58c1b9eb140c13ae31b","observation_id":"9cae750f-2587-4ca1-88f3-e75583e151c8","resolution":{"observed_at":"2026-08-01T15:16:14.134693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.242377Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.242377Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:9718935db732baf014c315eda0cd3570fadbb23a5f6e8ae746e5cc54f9b123e9","observation_id":"6728a5c1-0b1f-4253-97c4-046d8771266b","resolution":{"observed_at":"2026-08-01T15:16:14.242377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.327297Z","title":"On the Limits of","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.327297Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:3ea295d3ed064dd8c8eb3c2d9776938c86fe7ea370f1764b3a71f9c56a1b8821","observation_id":"8650d4b9-d380-4d2a-89a0-f46024c1e7d1","resolution":{"observed_at":"2026-08-01T15:16:14.327297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.406132Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.406132Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:53fb43d2246aa9025f9a03bce15beb98061fffd3ef768405901db695b59b55b3","observation_id":"467d64c5-f2cd-4572-a170-e50cd354927b","resolution":{"observed_at":"2026-08-01T15:16:14.406132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.471044Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.471044Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:7a7b5a182bc600a7f9f36f8eaad6a54351c0e3f7b791f67c2e76b263a85695bc","observation_id":"042f060e-c17d-44f4-939f-c7e173964bee","resolution":{"observed_at":"2026-08-01T15:16:14.471044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.598063Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.598063Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:879fbeebfbadb4d0be05293c72063ee02d1ed25d8f7e8b2ef3d6b5bfa2eaea84","observation_id":"b27331d8-64f4-47b5-b859-f09b6d073b63","resolution":{"observed_at":"2026-08-01T15:16:14.598063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.677547Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.677547Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:4ff902f982bba50139b94d3a93738bfd16af7ff0fd190edb5b2a09ad6bfdebae","observation_id":"59874cf3-8d33-4391-937f-60ac25e2127c","resolution":{"observed_at":"2026-08-01T15:16:14.677547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.747523Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.747523Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:231b5000fa1b888dd8566acace9b767fcc86f77d7bd1138325c42d1204574f32","observation_id":"ab57c9b8-672b-4e80-8a1e-80b946677828","resolution":{"observed_at":"2026-08-01T15:16:14.747523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:14.815561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:14.815561Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:ae1d8634d22fb70804a227ca61c5046851e4edf1b54ce5f4b65b660738f8f111","observation_id":"3ea5a647-9542-4900-a049-97d160b676a9","resolution":{"observed_at":"2026-08-01T15:16:14.815561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.019700Z","title":"and Spragins, John D","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.019700Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:220c104e6d45685e177ec8672e469318376609ca9a304963e4295bd90c80b0c1","observation_id":"65c73470-88b7-444d-8548-0bc050766d3f","resolution":{"observed_at":"2026-08-01T15:16:15.019700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.094412Z","title":"On the Direction of","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.094412Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:f70e39cecb360d157ce5ced9c53924f0901e91849e8e3abfc3b97cfba340933b","observation_id":"481ad52a-d756-478c-8517-25952180d99c","resolution":{"observed_at":"2026-08-01T15:16:15.094412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.262132Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.262132Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:8f7e44a36e9501d08af3388e662f8247a708c2bc7b26dd7df4a012a53d510b4c","observation_id":"57f14358-b1f0-4f17-9a2d-a3fce4a535b9","resolution":{"observed_at":"2026-08-01T15:16:15.262132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.356343Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.356343Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:185ca7b43b6862158381a6920333e6c479446a1443080b96e7d411a3da779107","observation_id":"a4ddcdd1-beb6-48fe-8f41-19a0e287696b","resolution":{"observed_at":"2026-08-01T15:16:15.356343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.450612Z","title":"and Fu, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.450612Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:4e249ddf0bef7bfa0c78fcda11fe80399db0557f8eb56500856143cb5713b13c","observation_id":"1ce70e93-0578-4921-87ec-31d8686c4f5e","resolution":{"observed_at":"2026-08-01T15:16:15.450612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.533323Z","title":"Neural computation , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.533323Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:a7f1effc0fd61ee70b79736778689a3f8a8aaef7092596b45035115db352c266","observation_id":"ee69454c-69e7-4093-9127-01f9b8345d97","resolution":{"observed_at":"2026-08-01T15:16:15.533323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.610158Z","title":"2017 , editor =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.610158Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:95df7fd6849636e381c25af16661eaa77e9def8dfb17f54a6407d7201d380d14","observation_id":"4395fd2e-2538-4e89-838d-91a570e3e027","resolution":{"observed_at":"2026-08-01T15:16:15.610158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.678014Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.678014Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:794db91c3db5a2dac2b9ba7b10c07595eada27f14a6b2479dd96b0c3ec9d2bc9","observation_id":"cd2e82d8-aea0-439d-ab6b-df7d719fcfff","resolution":{"observed_at":"2026-08-01T15:16:15.678014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.801597Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.801597Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:996fb123985654f155a338216e5716f28d684d81d7d2885d0a40a5e0fad6b422","observation_id":"54220faa-9214-465a-8618-85660cb82660","resolution":{"observed_at":"2026-08-01T15:16:15.801597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:15.980313Z","title":"Mechanistic Interpretability Workshop at NeurIPS 2025 , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:15.980313Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:99e163679fe317567ab7918be009d04223e30ac447746505456d4e4e8bf4367c","observation_id":"2b926bd8-6e17-461e-bdab-6e899cd33315","resolution":{"observed_at":"2026-08-01T15:16:15.980313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.039869Z","title":"Towards Understanding Fine-Tuning Mechanisms of","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.039869Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:d708184f5dce8850b354d8a6f4bceb71ce7a2eb8c0e6eda3267d1f88b13a0c72","observation_id":"630c407c-a66f-4480-b977-196daf945a96","resolution":{"observed_at":"2026-08-01T15:16:16.039869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.144526Z","title":"ICLR 2025 Workshop on Building Trust in Language Models and Applications , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.144526Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:026767746dec945a54ec160ee4dee8ef6dc89584cfa3bbb4c16069c74eef4ec7","observation_id":"9e5e1ac0-cb93-4dab-8106-9df9f2059402","resolution":{"observed_at":"2026-08-01T15:16:16.144526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.228601Z","title":"Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.228601Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:a96fb7636df72eb5d2e2fcfaef4849377543f46fc9f35e8f517e55848d406d97","observation_id":"d296e457-83f4-4039-a39f-d774b220f5b7","resolution":{"observed_at":"2026-08-01T15:16:16.228601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.343248Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.343248Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:17124cff9d9a0f658753010e7e53d551435cf777bcce5adff05578825d5ed860","observation_id":"50574a29-ae63-4fe4-bb1e-ffc014cf2002","resolution":{"observed_at":"2026-08-01T15:16:16.343248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.413360Z","title":"Workshop on Reasoning and Planning for Large Language Models , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.413360Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:dd06766a94ac32d9b2422ff0e33f673d6c7de239b7e136e06bcb72ef55fd7543","observation_id":"54b48bc6-6e46-434f-89c6-f4365975738d","resolution":{"observed_at":"2026-08-01T15:16:16.413360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.520411Z","title":"Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.520411Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:57198e6cb8d622b4216f3becf98a30f75a34b4df055fcc14c5e7994f9d86c19f","observation_id":"da6c3141-549f-43aa-8ee2-91ea6bfdbea9","resolution":{"observed_at":"2026-08-01T15:16:16.520411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.643332Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.643332Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:07714bff9fa38ca6ce8a4e37fd0a137a7554a14a9b3e160546309ea97f90645a","observation_id":"a6fa5c60-3bb7-4993-83f7-8ddb32e3a250","resolution":{"observed_at":"2026-08-01T15:16:16.643332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.866739Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.866739Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:3604fa62a4cc7c4097c72b7b88e58715de04020ced05ffd21bbd6671204f80fc","observation_id":"f8116245-94a6-411a-bc09-21ba5fa65f8c","resolution":{"observed_at":"2026-08-01T15:16:16.866739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:16.981690Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:16.981690Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:6b77c8b894daeb22b88797ef989201f8ddca8b3c7cae8f1efa74cd7e4d27f080","observation_id":"53c5c773-b076-460e-994b-3049f8fac1f0","resolution":{"observed_at":"2026-08-01T15:16:16.981690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:17.452678Z","title":"QwQ-32B: Embracing the Power of Reinforcement Learning , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:17.452678Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:b7e7eb1afd1f175babe9557eb1bf1d7be2e793ee9c8ee3843a134b5b0c306400","observation_id":"61f7b793-bbd8-4996-afd4-85a667aad898","resolution":{"observed_at":"2026-08-01T15:16:17.452678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:17.707886Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:17.707886Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:dc07e1f6736139be165e6f58d1491e20277c81df88f841ea9676e2d44d200176","observation_id":"9d0feb81-2050-4136-93cb-a57b02161405","resolution":{"observed_at":"2026-08-01T15:16:17.707886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:17.816565Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:17.816565Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:aab8e4c7d7c5293eb1c82d5234f79fcbaf5d64b4bebf4d1ba157207172d797c7","observation_id":"f5990075-718f-479f-9710-f153f3c414d7","resolution":{"observed_at":"2026-08-01T15:16:17.816565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:17.937789Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:17.937789Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:8b289817cc849311423c5dccb0cd0781d55430d4a67d73bfa0eb87954d62a185","observation_id":"fee474c1-646b-46b4-b2c0-a875375e7dd2","resolution":{"observed_at":"2026-08-01T15:16:17.937789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:18.051644Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.051644Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:064bb74487f93797d83b847dfb992dfde233b4196b08719b5e15819d70830424","observation_id":"9f8cd739-d4a3-4d91-80f4-3e502332c454","resolution":{"observed_at":"2026-08-01T15:16:18.051644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:18.171431Z","title":"2024 , month = aug, journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.171431Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:8c262d82195fb6d93cdc839feec1858d09b1cb814ec9d3989c8053e1f961982e","observation_id":"c1a7d186-5f2b-4244-86a1-8d38051610ce","resolution":{"observed_at":"2026-08-01T15:16:18.171431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:18.289118Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.289118Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:34abceda0198ad824a791c4207a704c11caa90ac2b800940563704921899b4ad","observation_id":"225151fe-8573-4ab5-b0f2-7e6505fbcb51","resolution":{"observed_at":"2026-08-01T15:16:18.289118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:18.387352Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.387352Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:9c04b96e4a577e80a0190f4b27eb703154a3897b9d9d5af1d1f1022bc2d4058e","observation_id":"428c6fe0-8b92-49d3-8936-030695d31b1f","resolution":{"observed_at":"2026-08-01T15:16:18.387352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:18.507344Z","title":"Ackerson and K","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.507344Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:2517c68c06796b75e02d0ec127d4ba50f313bc18691e96927680d09666fe7188","observation_id":"7bb7bf73-2cc3-4f78-9efc-07ade3fe236f","resolution":{"observed_at":"2026-08-01T15:16:18.507344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:18.625152Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.625152Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:bdfe6eb54141c4f4861717878ff6d0a930e5cd5750d369ec2452e6e282ff9f38","observation_id":"e88f86d1-e470-4804-b859-fb76df477f91","resolution":{"observed_at":"2026-08-01T15:16:18.625152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-01T15:16:18.727168Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.727168Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:72214e9f0d87255ab8b296683c084cac817034770768310a04d16832e321b93e","observation_id":"44f25d29-4d44-4d87-b9ae-14a3052e1a72","resolution":{"observed_at":"2026-08-01T15:16:18.727168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:18.872972Z","title":"On the identifiability of switching dynamical systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:18.872972Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:68365175870cb2d2bffd1b11366859bc5d919d9b4536f0d957627458c652c7ee","observation_id":"3cbf0cc6-f2e8-4005-85a6-b52cc9a20e8a","resolution":{"observed_at":"2026-08-01T15:16:18.872972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:19.017904Z","title":"Bogdan, Uzay Macar, Neel Nanda, and Arthur Conmy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.017904Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:c346d259505c15b4fc0b93e54c61c58e81f06832497907fc5c78f6c90b18c031","observation_id":"5218849b-2c28-4c8b-b8ee-efb2367ce13e","resolution":{"observed_at":"2026-08-01T15:16:19.017904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:19.135142Z","title":"A statistical physics of language model reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.135142Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:df239cd9889f04ee822e79c6acf4342f26ccf2ea1753fc843c49852d38ea1caf","observation_id":"20f4bf1c-0488-4917-9586-2376a3cff0d4","resolution":{"observed_at":"2026-08-01T15:16:19.135142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:19.233415Z","title":"SEAL : Steerable reasoning calibration of large language models for free","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.233415Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:30d067a83ffc4a1ca0bb1b03883fcf48631c964e0fa9fcfe84ee4e9c4f51101e","observation_id":"512e6320-024c-4caa-8445-8b1cf574c0ab","resolution":{"observed_at":"2026-08-01T15:16:19.233415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T15:16:19.284845Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.284845Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:2da715d2837ba7b16b9f9c2198105793e8f75fd34571a752f0092989fbbe88b9","observation_id":"ace043ea-d3d4-43c4-88c9-7942c4c9783b","resolution":{"observed_at":"2026-08-01T15:16:19.284845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T15:16:19.344259Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.344259Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:3e276db59be0569ca3a1cd1bfaaa3d6ec410efbf3cb708be830ffdd1f97e079a","observation_id":"6b08b06a-9f2c-4e64-af04-aab8727a9034","resolution":{"observed_at":"2026-08-01T15:16:19.344259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1214/009053604000000021","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asymptotic properties of the maximum likelihood estimator in autoregressive models with markov regime","venue":"The Annals of Statistics","work_id":"d497785a-3b34-4387-bced-a930c1393557","year":2004},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.438599Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:0068b80716884dbf77d56041d42026233e5f1560611f71e63cae37f2fa22f0c4","observation_id":"70284a98-88aa-4380-a7e5-48c4bca322a4","resolution":{"observed_at":"2026-08-01T15:18:36.075659Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:19.513576Z","title":"Variational learning for switching state-space models","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.513576Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:5f043aebcfe6ae06a65ef7e25a8f13b0fedced5fe540e03263a6ba5e7d92e30c","observation_id":"77f71155-c3a6-4da7-8e08-3e46fc698976","resolution":{"observed_at":"2026-08-01T15:16:19.513576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-01T15:16:19.587543Z","title":"Measuring mathematical problem solving with the math dataset, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.587543Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:d30b29c640afcc2347f806003c5000078644561feee780611ada003e08b37472","observation_id":"5eaa8c9a-8439-4081-ae5c-a8f6bb238749","resolution":{"observed_at":"2026-08-01T15:16:19.587543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:19.658340Z","title":"On the direction of RLVR updates for LLM reasoning: Identification and exploitation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.658340Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:78d0f3405a4e89cdc8420d7e07c7563962b47f47bbaf69a8ca1e01d88cfe1be2","observation_id":"3210d02a-0435-42ce-ac1e-c12e06c530c9","resolution":{"observed_at":"2026-08-01T15:16:19.658340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-01T15:16:19.738268Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.738268Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:486f695ff6e5e1d62f2dd7d56d4f1bba39d4c004e56a9c7e566b3acc0a99cc29","observation_id":"097ff543-1f93-46fe-aa8e-85ee20435285","resolution":{"observed_at":"2026-08-01T15:16:19.738268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10185","last_updated":"2025-05-15T11:31:02Z","snapshot_observed_at":"2026-08-15T21:12:19.695415Z","submitted_at":"2025-05-15T11:31:02Z","title":"The CoT Encyclopedia: Analyzing, Predicting, and Controlling how a Reasoning Model will Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10185","snapshot_observed_at":"2026-08-01T15:16:19.811207Z","title":"The cot encyclopedia: Analyzing, predicting, and controlling how a reasoning model will think, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.811207Z"},"links":{"cited_paper":"/paper/2505.10185","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:898f498e392f338557196ae4879d221bd1fc980ddf9cba63e7f8928c17e2c56e","observation_id":"2f6276b5-af19-497b-ba48-1973f23e5736","resolution":{"observed_at":"2026-08-01T15:16:19.811207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:19.877258Z","title":"Clue: Non-parametric verification from experience via hidden-state clustering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.877258Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:35b47de5963d65558955b65270e00e7d01d869baaa9625015ed5f4708eb6a2e5","observation_id":"f94be62e-2ada-4fe9-8fb0-fe73221fb720","resolution":{"observed_at":"2026-08-01T15:16:19.877258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:19.948636Z","title":"Bayesian Learning and Inference in Recurrent Switching Linear Dynamical Systems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:19.948636Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:f183c9b6d472672e8b5a6d04ae56d35331fb609042e8a832e80881e9d9348b58","observation_id":"148555f6-d956-4d39-8031-a158ce7cf927","resolution":{"observed_at":"2026-08-01T15:16:19.948636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.033854Z","title":"Learning a generative meta-model of llm activations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.033854Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:9ebb72504669ae24738a8caa7387c1bfbe1d62e0c678aeb8d320f6aacbc3e3a6","observation_id":"9a20706a-5886-4b1f-98de-690212d3e067","resolution":{"observed_at":"2026-08-01T15:16:20.033854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27484","last_updated":"2026-04-13T14:41:26Z","snapshot_observed_at":"2026-07-06T22:34:33.419178Z","submitted_at":"2025-10-31T14:02:37Z","title":"Thought Branches: Interpreting LLM Reasoning Requires Resampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.27484","snapshot_observed_at":"2026-08-01T15:16:20.107692Z","title":"Bogdan, Senthooran Rajamanoharan, and Neel Nanda","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.107692Z"},"links":{"cited_paper":"/paper/2510.27484","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:8e889943f1a9788ad3685c6a01a8c82f03a4dc48ba82dd70ae631fd202f28287","observation_id":"f5477018-f50b-47dc-8d13-76beba001d38","resolution":{"observed_at":"2026-08-01T15:16:20.107692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.156420Z","title":"Narrow finetuning leaves clearly readable traces in the activation differences","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.156420Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:73e445714bce00548c1056c22ecb69844c9be8e23469702f530cd00134f26918","observation_id":"eb1d2b8b-99c5-40e1-8dfc-91c1afe523c8","resolution":{"observed_at":"2026-08-01T15:16:20.156420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.213159Z","title":"Diab, Virginia Smith, and Dawn Song","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.213159Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:3e22552462cb9cac0b031a85a6e8c51b6e26ad3179735639464f2649ff855b63","observation_id":"a7fada9f-7740-45c3-aa0a-411da92ede04","resolution":{"observed_at":"2026-08-01T15:16:20.213159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.267179Z","title":"La, Duy M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.267179Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:8f377b5097dabff0fafbbc7164e43867d6df612c45b0991887a8566f3bf2c978","observation_id":"05a6d9c7-35b3-44c4-89bc-836597cd8b16","resolution":{"observed_at":"2026-08-01T15:16:20.267179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.324657Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.324657Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:f66763012cee957c40f173cbcc9529af3e4c3c6e2b2dd6e2ab24aa9f634f278f","observation_id":"1029cfcf-3514-4aa6-a2ee-6900768ac5b8","resolution":{"observed_at":"2026-08-01T15:16:20.324657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.400811Z","title":"Demystifying reasoning dynamics with mutual information: Thinking tokens are information peaks in LLM reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.400811Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:dfd5aa8e68e1d2aeaa76d19f27beac9658678a21fe5020b106559d7d9ae5cf25","observation_id":"105d9ba2-7d4e-4233-a7dc-a4bf246b3867","resolution":{"observed_at":"2026-08-01T15:16:20.400811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.504062Z","title":"Learnable latent embeddings for joint behavioural and neural analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.504062Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:b9364b758185877146a9b19dd44eda3efea69a791d668b49eb56a02f9c5db540","observation_id":"ef28362d-1aac-4f39-9ed9-9a994a4888a0","resolution":{"observed_at":"2026-08-01T15:16:20.504062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T15:16:20.617290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.617290Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:3057f4da92ba1292abead2d1876d20a2975299a1dbcc2f5e358df7f73fe37e66","observation_id":"b5990ec5-5c43-40ac-a081-b8e8e931a8ec","resolution":{"observed_at":"2026-08-01T15:16:20.617290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.713420Z","title":"Understanding reasoning in thinking language models via steering vectors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.713420Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:dd3da003882178560c43d393b15a9af7ce49bf9f959757e2178eb57652196af3","observation_id":"abc2bec8-ab5a-4f28-be14-fd6ae8b393ff","resolution":{"observed_at":"2026-08-01T15:16:20.713420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07364","last_updated":"2026-07-07T14:19:58Z","snapshot_observed_at":"2026-08-04T11:02:17.680858Z","submitted_at":"2025-10-08T17:58:28Z","title":"Base Models Know How to Reason, Thinking Models Learn When","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.07364","snapshot_observed_at":"2026-08-01T15:16:20.782109Z","title":"Base models know how to reason, thinking models learn when, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.782109Z"},"links":{"cited_paper":"/paper/2510.07364","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:1fae3b7314c2b81dc9aa9b7c46418b6d46a4e31a164e57e6a7b950a70fee10c5","observation_id":"de19a86b-b3f8-46dc-a0c7-27e2c4d16e13","resolution":{"observed_at":"2026-08-01T15:16:20.782109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-13T06:08:42.070209Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-01T15:16:20.893289Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.893289Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:573d832979a2befd6caf5855913e57b76f1a76eb7c6769691d1b7f8781d14582","observation_id":"68b545c0-b727-40d3-8cf8-685a9d3bdbde","resolution":{"observed_at":"2026-08-01T15:16:20.893289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:20.964020Z","title":"Towards understanding fine-tuning mechanisms of LLM s via circuit analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:20.964020Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:65f3a579e07ba1351595b4728217fc53327c01c7e885ebf54465c9acd840ed94","observation_id":"088cf89d-45ac-41fc-b511-ae95e7b496a1","resolution":{"observed_at":"2026-08-01T15:16:20.964020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-01T15:16:21.070905Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.070905Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:ec08fb1f0b8747d7d0408f0681aa48fef01228292eadb5b3d1bfebee4a3d55fd","observation_id":"ef769a69-4967-46e1-9560-0f82b6e00b25","resolution":{"observed_at":"2026-08-01T15:16:21.070905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12638","last_updated":"2025-07-16T21:21:03Z","snapshot_observed_at":"2026-08-08T14:46:42.003088Z","submitted_at":"2025-07-16T21:21:03Z","title":"Reasoning-Finetuning Repurposes Latent Representations in Base Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12638","snapshot_observed_at":"2026-08-01T15:16:21.171395Z","title":"Reasoning-finetuning repurposes latent representations in base models, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.171395Z"},"links":{"cited_paper":"/paper/2507.12638","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:e889316b9984b22d6b94fc603496a3ca691f179a450a0e16058b6fad55c835fe","observation_id":"d1b1a916-9964-45b0-91f3-c4a1b61dcfc8","resolution":{"observed_at":"2026-08-01T15:16:21.171395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:21.241977Z","title":"Rank-1 loras encode interpretable reasoning signals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.241977Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:f85712abe64c286d6118ca26f97a888bc7d1ea9e3cda8e04228a07179941fd25","observation_id":"a095c327-b401-4bce-ad08-19f547317a1d","resolution":{"observed_at":"2026-08-01T15:16:21.241977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:21.323304Z","title":"On the limits of RLVR : Support, entropy, and the illusion of reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.323304Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:113bb796e1ffb9bf724ed4297a071dbd1994c152af3a35a43fda8155db4964b9","observation_id":"757871bd-ffcf-445d-95be-d910dad14927","resolution":{"observed_at":"2026-08-01T15:16:21.323304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:21.396068Z","title":"CTRLS : Chain-of-thought reasoning via latent state transition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.396068Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:2642db40bf9b6fe419b2953931aa39b11898c024d49780db1624888332e1098e","observation_id":"0548a8f8-b974-4f50-87f4-108e828d447e","resolution":{"observed_at":"2026-08-01T15:16:21.396068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:21.468535Z","title":"Yakowitz and John D","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.468535Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:7a9022388510d29eb4e076464544ce82ca4f1f9028a03777c44b070ff0e37975","observation_id":"e79d1087-996e-49e7-b07e-f4815b7116d5","resolution":{"observed_at":"2026-08-01T15:16:21.468535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-01T15:16:21.564657Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.564657Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:ad1ab83f9d78b362185a36c16604b4c349f6308aa90c133e8db00788ca744514","observation_id":"11e2a532-030f-4bcb-959e-fd2c96be1b83","resolution":{"observed_at":"2026-08-01T15:16:21.564657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-01T15:16:21.608057Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.608057Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:771a473e10ccb89698b7f2fdcece50a74c30e0658605f1f2242aad4f87e89e82","observation_id":"8d4e677c-f82b-45cf-8808-8cf8d0623749","resolution":{"observed_at":"2026-08-01T15:16:21.608057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-01T15:16:21.697846Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.697846Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:682753a6a68925c303eeea1bec5c1108783c302be8ed3ad6bca9bdcc7f8c307b","observation_id":"14968147-d138-4ad7-9bf1-d7be20e534cb","resolution":{"observed_at":"2026-08-01T15:16:21.697846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19633","last_updated":"2025-03-25T13:19:46Z","snapshot_observed_at":"2026-08-12T22:48:57.315672Z","submitted_at":"2025-03-25T13:19:46Z","title":"1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19633","snapshot_observed_at":"2026-08-01T15:16:21.796399Z","title":"1.4 million open-source distilled reasoning dataset to empower large language model training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.796399Z"},"links":{"cited_paper":"/paper/2503.19633","citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:9d55ec505acb4f23c28d6f7ce6e302c7f0ff1783d215013af86183a7dfd90c2b","observation_id":"5e8206db-ed4d-4f84-bf78-8b65574e8cf3","resolution":{"observed_at":"2026-08-01T15:16:21.796399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:16:21.881919Z","title":"The path not taken: Rlvr provably learns off the principals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T15:16:21.881919Z"},"links":{"citing_paper":"/paper/2607.18532"},"observation_digest":"sha256:59f8b92dd774417351aa77dba244128ec6993646551effc12c8b175091579919","observation_id":"f0555707-067a-4fbd-964d-8e4fd93601b9","resolution":{"observed_at":"2026-08-01T15:16:21.881919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18532","last_updated":"2026-07-20T21:56:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:52:33.147531Z","submitted_at":"2026-07-20T21:56:22Z","title":"Reasoning Fine-Tuning Induces Persistent Latent Policy States"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2607.18532."}