{"as_of":"2026-08-06T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbf246bdf3b7e53ecd4ca8313e27aa3460741871f86e9abfcb75e869f3f8e48d","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T19:39:55.294398Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.15604/citation-record","integrity":"/paper/2605.15604/integrity","json":"/paper/2605.15604/citation-record.json","paper":"/paper/2605.15604"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":"a47222a6-2f2e-41ad-9fcb-e5ea13111a1f","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:99b02f8cc58119faf0d4565d35c895c4c1b742a5a53d0c2fd4c7b30557fedae6","observation_id":"e363cc29-f795-4b18-b605-ab4bd9d82f3e","resolution":{"observed_at":"2026-05-20T19:43:56.363818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude sonnet 4.6 system card","venue":null,"work_id":"a5d68961-13ed-493e-bbea-1479599da6dd","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:121d87b64af097b85aac7106e33647ad212a0cb7fe58d4022d37df95eb5bf9a1","observation_id":"04694238-4207-4668-ab96-259ae034b6b8","resolution":{"observed_at":"2026-05-20T19:43:56.365884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activation steering for chain-of-thought compression","venue":null,"work_id":"ba22c371-e108-4574-b684-9b64c8bda464","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:c047e636186e217a63c74febdd4992790a2511cc0420166b3c7f71feff00a85d","observation_id":"f45b8f09-c80b-4e84-8734-5578f51f7ffd","resolution":{"observed_at":"2026-05-20T19:43:56.370076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding (un) reliability of steering vectors in language models","venue":null,"work_id":"266b0a6d-27cc-4ce2-9aef-7dabf4186d33","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:5a4f31ea0c5c5683c0cba6b2fd92caed1e8cb81073b94788f21444a35663a7e2","observation_id":"10ee9ca9-5157-4c68-bd7a-4584e790968f","resolution":{"observed_at":"2026-05-20T19:43:56.367819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21509","last_updated":"2025-09-05T07:44:31Z","snapshot_observed_at":"2026-07-31T17:57:12.284928Z","submitted_at":"2025-07-29T05:20:14Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","version":3},"cited_work":{"arxiv_id":"2507.21509","doi":"10.48550/arxiv.2507.21509","metadata_source":"pith","pith_arxiv_id":"2507.21509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","venue":"cs.CL","work_id":"cf32dbef-9132-4648-abcb-0ebf3ac3af80","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2507.21509","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:568a1a8920dd8ba6f6210836ee8b4f242bd16cb7a4d74ece34e867d0a2f73234","observation_id":"7008a403-71e3-47b0-8871-04a54cdb4fa3","resolution":{"observed_at":"2026-05-20T19:43:44.151368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:54.586724+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:54.586724+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:0c6aaf4245084a2c75f636571d85d25aedb0e20a92b70ae8f7d9e02b8b24d406","observation_id":"e8d62e93-8bb1-4e2e-a063-430afdaddac6","resolution":{"observed_at":"2026-05-20T19:43:44.137244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-07-06T17:26:47.184846Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:08e81be64ff1520a0ae3478589a152e1eeb8de801b5813d7f635451714354fe0","observation_id":"dec601cd-24b2-4258-86b4-a06000049b14","resolution":{"observed_at":"2026-05-20T19:43:44.127323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17813","doi":"10.48550/arxiv.2505.17813","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don’t overthink it","venue":"Open MIND","work_id":"a34204a7-e7e2-4b25-86e0-559b519bef00","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:1692defa78c86a58f2fb1261d3d95164da938a83c975bf3d470994909b2faf8c","observation_id":"5b928ecd-8646-4a6e-a50e-51ef84413b3a","resolution":{"observed_at":"2026-05-20T19:43:44.149895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:fae9b5dc228a365f6fa6aa83575732c383c65fb52008f0bac80950e1d8ece33a","observation_id":"391447cc-d2db-4a2a-bb9a-d3a0be7a0926","resolution":{"observed_at":"2026-05-20T19:43:44.141855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:57da43dac141a3d042152f1a4df58627fdc250c29ba0918ca4882ac864048af7","observation_id":"ee4c761c-ef5e-43c4-875d-33850e9552fc","resolution":{"observed_at":"2026-05-20T19:43:44.139152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing to correct: Calibrated reinforcement learning for multi-attempt chain-of-thought.Interna- tional Conference on Machine Learning","venue":null,"work_id":"9f38744a-ef6e-40d9-8c60-9e44609d4fc5","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:4ea836a3afd134e5c093e9a56a997f03e51bb7686ea47b4069327d0d6e0613f9","observation_id":"d7cef652-729a-4fee-80aa-a673757f5e78","resolution":{"observed_at":"2026-05-20T19:43:56.385263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.02716","doi":"10.48550/arxiv.2502.02716","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A unified understanding and evaluation of steering methods.arXiv preprint arXiv:2502.02716","venue":"ArXiv.org","work_id":"d25a0fb3-00cf-4b5a-aa4c-77000e92c3fc","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:f9c0afa8de6f39540ab220b12c99aa0f2dc2ca8597f2d5824ddf8a91ce61b9d8","observation_id":"380421ee-0435-4fe5-9099-23d0f741f71e","resolution":{"observed_at":"2026-05-20T19:43:44.131107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C3ot: Generating shorter chain-of- thought without compromising effectiveness","venue":null,"work_id":"c4c0c175-8e87-46d7-b982-8259998af073","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:6fdeea2fe3adc2f18d38fef18ede413d6ff97af811b16f8ecbeb65fdfc7c0245","observation_id":"59d7abc3-5512-487e-b92b-75b52ca6d136","resolution":{"observed_at":"2026-05-20T19:43:56.362020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vineppo: Refining credit assignment in rl training of llms","venue":null,"work_id":"20d3cf55-0825-4e31-887c-5f65a7aeb498","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:aafdc79740e964654fc51a2424288d7f0636cff73c7778cd2c25eae39e28fc78","observation_id":"2a16f113-bd48-43c8-8b03-f9eca08fac5d","resolution":{"observed_at":"2026-05-20T19:43:56.359707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlaif vs","venue":null,"work_id":"ecd032d1-a998-41e3-be3b-6b8b59aff518","year":2024},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:4bc0680d748585b45717978a395f9ad0192ba1b8116e61bbf273108572fcaba8","observation_id":"b8fc747b-e446-4d8d-9c7f-f5004dc57546","resolution":{"observed_at":"2026-05-20T19:43:56.357843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"s1: Simple test-time scaling","venue":null,"work_id":"e7ef2749-3266-4759-8778-b5afdb6ddc24","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:b9457e3bedbc10076d5f5d3350f8155cd685981554d47b362f840fbfb83b5492","observation_id":"9e57dcf7-b26b-4bde-bb39-cace9c897200","resolution":{"observed_at":"2026-05-20T19:43:56.355948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:6bbf663830ca6df03306b0f31ee865bf232e602dbe27545741fc804f36ade47d","observation_id":"9874668d-5e5a-4efc-9980-f2c010ff29a9","resolution":{"observed_at":"2026-05-20T19:43:56.373805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-06T00:58:30.657180Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":"2312.06681","doi":"10.48550/arxiv.2312.06681","metadata_source":"pith","pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Llama 2 via Contrastive Activation Addition","venue":"cs.CL","work_id":"3317feaa-e788-45fc-95aa-4ea20028b55b","year":2023},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:87110cddd97ccb7fd6c2ff6838c8f2f7f420b046b216e9a67f94fb0f8dee5fbd","observation_id":"144e89cc-4961-4941-93fa-67681e3221d0","resolution":{"observed_at":"2026-05-20T19:43:44.145911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:04.515131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:04.515131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:e629e7f10e4732d0d9309282447c296d5fabf7e508d0534fb729daebe7e231bb","observation_id":"c97cefed-000b-4e28-bac9-e68f81033ae3","resolution":{"observed_at":"2026-05-20T19:43:44.119436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A critical evaluation of ai feedback for aligning large language models.Advances in Neural Information Processing Systems, 37:29166–29190","venue":null,"work_id":"9169830b-8171-4e38-be26-eb9eb0580047","year":2024},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:b9165064b83d3f18e701803e4333d4d6d387cfd001269193eaba7d09900fb4fd","observation_id":"c01a0aa3-ee99-4603-9379-ac4379f4ebce","resolution":{"observed_at":"2026-05-20T19:43:56.419630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:a11587ffd67815b77b9687b2cd1453ad4b6ebb209bea9c21d0011ad4b3d34a8c","observation_id":"582da890-7dae-43ed-8eb8-952f84c2cbbd","resolution":{"observed_at":"2026-05-20T19:43:44.108496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-04T09:41:45.042008Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":"2209.15189","doi":"10.48550/arxiv.2209.15189","metadata_source":"pith","pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning by distilling context","venue":"cs.CL","work_id":"154b4a90-a354-4ade-92a0-d166d944e9e2","year":2022},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:c38b6d7744814866d2929d298d7e486b3cedf2be37fb6a0ffd31c12cc6ff7280","observation_id":"8d283293-324b-431b-a553-37de5b1c0d88","resolution":{"observed_at":"2026-05-20T19:43:44.111000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:46.165167+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:46.165167+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:8840d4446be02e1b7e71d06f71c8ed76ad36b9aa9aee4d1925d0d27eaeaf28ee","observation_id":"ba4c5171-639e-4ac6-8220-f1a1fc046eb0","resolution":{"observed_at":"2026-05-20T19:43:44.154250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":"2308.10248","doi":"10.18653/v1/2024.findings-acl.611","metadata_source":"pith","pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Language Models With Activation Engineering","venue":"cs.CL","work_id":"d525fe06-5560-4e97-86fc-7a0e551f5b17","year":2023},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:7916261b05f40cac677e5e5763cf5cb4b671d6c9765248025aa85350dbbcf49c","observation_id":"6c9d7f68-fd8b-4b16-8085-516faa7cda0a","resolution":{"observed_at":"2026-05-20T19:43:44.085040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.345368Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Systems, 37:95266–95290","venue":null,"work_id":"8ce2e771-bc8c-4b3b-a834-6303b981b746","year":2024},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:092345b39f679ee18d5f6827d16571614bfabfbf90aa73e285ec534997e9f7c1","observation_id":"98c04faa-dc4a-4535-9d64-f9157b743716","resolution":{"observed_at":"2026-05-20T19:43:56.416993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Projection optimization: A general framework for multi-objective and multi-group rlhf","venue":null,"work_id":"dc54d240-09a5-4561-b0d2-e42528971e2b","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:ad4c6dd3591661464e41b9b5713b5756c247b3f8462f22dab56b1616e5852ed2","observation_id":"68847fe6-d95e-42f3-8de6-13b399c235c3","resolution":{"observed_at":"2026-05-20T19:43:56.414758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:e877c822b4695412da02deddb9d561cac0a389dc0c371f8a697f8b2a1662bdf0","observation_id":"99e7b061-17b9-4caa-aaf7-c0dc7f89bef5","resolution":{"observed_at":"2026-05-20T19:43:44.115847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rewards-in-context: Multi-objective alignment of foundation models with dynamic preference adjustment","venue":null,"work_id":"66a54d25-d55e-47ed-8fae-248ee241aeeb","year":2024},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:e10d3cdd4aacd694f8ecb7cac4078b409101854e2feb98caeb2032e7f7343ed7","observation_id":"0a4b1931-0994-46b7-892b-4159a48a53e9","resolution":{"observed_at":"2026-05-20T19:43:56.412808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards better rl training data utilization via second-order rollout","venue":null,"work_id":"1c6bd3d7-9063-4b08-a69e-c05d7d0afec9","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:9ded3b3ffb61a6495c42ab6c1c8823abcf323bfd1b0f32ee6130a416839917ce","observation_id":"f4ab8d20-7e5e-4a4c-9342-f3a3303e9616","resolution":{"observed_at":"2026-05-20T19:43:44.099436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Incorporating self-rewriting into large language model reasoning reinforcement","venue":null,"work_id":"5a5067e8-e21b-40fe-9273-5c6b13be4887","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:598b33c55f28615f3da3129193d79da832930249fdd226ff4124c81e33771052","observation_id":"799081f9-c402-450a-864f-c838339e5332","resolution":{"observed_at":"2026-05-20T19:43:56.410966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bread: Branched rollouts from expert anchors bridge sft & rl for reasoning.Advances in Neural Information Processing Systems, 38:96726–96752","venue":null,"work_id":"c4167a54-fe6a-4157-9cb3-838605011289","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:193678ba767a299e4f92406549ce84be637ca75caffaae5080927ee488c12192","observation_id":"8d7366a9-38c1-4873-9df2-ea77cee01a6b","resolution":{"observed_at":"2026-05-20T19:43:56.408849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-06T01:21:05.306042Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":"2505.07961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making small language models efficient reasoners: Intervention, supervision, reinforcement","venue":null,"work_id":"33945f95-e9a3-476d-bc19-3bf159e1763b","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:9cb4c80c7aa0b3a47f7c71bcdce94b6e7600cb1ed71b8a34188d53c4103ff825","observation_id":"6788d978-46b9-445a-9287-e00caccf6347","resolution":{"observed_at":"2026-05-20T19:43:44.123476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-05T07:13:28.092224Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:0d0b976ab14eb431c02ae63836de87105abad06989d9b235adbec880fc9c6bdc","observation_id":"93f02824-4813-43db-8fb5-c26a3b1cddbc","resolution":{"observed_at":"2026-05-20T19:43:44.148478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":"2310.01405","doi":"10.1609/aaai.v36i9.21196","metadata_source":"pith","pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","venue":"cs.LG","work_id":"45b326e2-e962-41a5-a542-2559e103a19b","year":2023},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:7954e4eadfcaad523611f2f7cfb03d4d99dae6539de1ae87d766d3ed10809f12","observation_id":"272241b5-8096-4b8e-9445-ff91a6c93d4e","resolution":{"observed_at":"2026-05-20T19:43:44.157561Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Prefer examples and intuitive explanation","venue":null,"work_id":"53b88839-58bb-469e-adc8-6ca94c63c702","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:79ab9d8488371564859e5b7da02d4dbe43b26c62e330fa6b653b6a470d71244c","observation_id":"6a825139-05ea-4274-9e15-d4d11a42a97e","resolution":{"observed_at":"2026-05-20T19:43:56.406338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f406fca-bafc-4765-84cf-b2e9c6259f76","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:af19d4a9f66a9e3b7b03905d647f7b28c2b77e1d9cc6e447141eab7967234fb2","observation_id":"71ce2995-f8fe-4e74-9d23-541b0f39ac66","resolution":{"observed_at":"2026-05-20T19:43:56.382452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"38d93772-17ac-42cb-b907-1fb193bb7aa5","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:89c25fbbc1b0bd208fda6edbce7b5ed6a17129bc542352e991aeec4425892ad7","observation_id":"4d405b0e-cf89-4cbb-9988-41d5573b4c9d","resolution":{"observed_at":"2026-05-20T19:43:56.404242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce9008e6-0f97-4951-afe2-9c578235a666","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:d66c3afdbaf9dca1900ac5ad470c2a6d2987886b23344d1388b10affb9a860e0","observation_id":"8a2a3f42-4eb8-4ef3-8d5a-337774eb6e46","resolution":{"observed_at":"2026-05-20T19:43:56.402275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2d494ffe-db18-470f-bdcf-fcced7317e53","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:6589af9431a4875ab76ce763eee1192c73e9c6ff016428bc2d9dd4e8c931d80f","observation_id":"e7022d39-f861-4be1-92cd-e7c39b6d6b84","resolution":{"observed_at":"2026-05-20T19:43:56.400383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Confident","venue":null,"work_id":"0aaf4f6b-2c3c-492a-bad6-a01db040433b","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:58162b996653476254f148aaacdc241c26072518b84f44af04e8aa15fdd6d869","observation_id":"89482fc7-8407-45a7-b50f-7b41ffe6d64c","resolution":{"observed_at":"2026-05-20T19:43:56.388841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It reflects the initial desire or drive toward the reward","venue":null,"work_id":"1a823d9d-9db0-4f14-81a0-97e92ed954ca","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:c5eee9a152c0fd4f5e17a11776656ad18d5083c4716b2265caf51fc8359b43e7","observation_id":"94b4d740-a0b8-4369-a12c-9f3cbf012e01","resolution":{"observed_at":"2026-05-20T19:43:56.398684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It is the action that leads to reward or satisfaction","venue":null,"work_id":"230d3674-68e8-430e-80b6-61dca04f47a4","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:1375d8192dbe873c6a6fa4bf8a5faf407f9c63d21106502a29eefc5b32c0e77b","observation_id":"47ea09be-953d-4f64-aeac-4169de7250b1","resolution":{"observed_at":"2026-05-20T19:43:56.396751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Now consider the options: - Option A: Appetitive behavior, exploratory behavior, quiescence","venue":null,"work_id":"23df2fc1-23b1-4515-8bc0-9b1ea0380771","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:9fac89b6e68fcd44ee764c3e98e2eff05237976492c424a80e02566250e6f217","observation_id":"3a7d55ae-6c2d-4cad-9da3-50f2ba7e9054","resolution":{"observed_at":"2026-05-20T19:43:56.394867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Adding a constant to all values of a variable does not affect the correlation","venue":null,"work_id":"d41b1df2-0ad4-4ea6-afec-284b9aed0d95","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:57607a20885c922ec45113e4e6b9c422f6caddb0d16186e0fa7c3dc1430fb5b5","observation_id":"68de9988-2b8b-4730-8f0e-c0564b0ea161","resolution":{"observed_at":"2026-05-20T19:43:56.387080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Scaling a variable by a positive constant, here 2, also does not affect the correlation","venue":null,"work_id":"181bacbf-8507-4cd7-b581-dac68d03d2ee","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:f78e3fea4a8936c521c053f0de9a83adf6e99f81584e1718e1d28e1650e52ed4","observation_id":"a4ca5512-dace-41f8-9800-7ec909263a23","resolution":{"observed_at":"2026-05-20T19:43:56.392659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Correlation is symmetric in its variables","venue":null,"work_id":"b142df84-9aed-463c-a594-c65775171b78","year":null},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:ee3092810701fe9b5c16010e1e2522e9620e8d2c61bb2e0b38485be639055fbe","observation_id":"19594a43-ce4d-44b1-850c-495b5cb4ef94","resolution":{"observed_at":"2026-05-20T19:43:56.390637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":17,"verified_fuzzy":24},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2605.15604."}