{"as_of":"2026-08-16T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea55bd302891f476249742657c227d7adb164f79f6609c9136c8c24d1b9dfa45","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:19:51.917733Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:21:33.975739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T15:02:45.745385Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"cited_work":{"arxiv_id":"2502.01876","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01876","snapshot_observed_at":"2026-08-15T15:02:45.745385Z","title":"Reinforcement Learning with Segment Feedback","venue":"cs.LG","work_id":"866c8f08-455b-4b4d-a561-be944139224d","year":2025},"citing_paper":{"arxiv_id":"2608.02951","last_updated":"2026-08-03T23:28:06Z","snapshot_observed_at":"2026-08-16T17:36:05.073628Z","submitted_at":"2026-08-03T23:28:06Z","title":"SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:45.617996Z"},"links":{"cited_paper":"/paper/2502.01876","citing_paper":"/paper/2608.02951"},"observation_digest":"sha256:02925d558104059cf228bf6fc6611230cc0496ebce010969ae22ac721b7468bf","observation_id":"2f6a9377-259a-45e1-9173-21492ddfe58f","resolution":{"observed_at":"2026-08-15T15:02:45.752291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01876","snapshot_observed_at":"2026-08-15T18:21:33.975739Z","title":"arXiv preprint arXiv:2502.01876 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13026","last_updated":"2026-08-13T09:54:14Z","snapshot_observed_at":"2026-08-16T22:10:54.812715Z","submitted_at":"2026-08-13T09:54:14Z","title":"Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:33.975739Z"},"links":{"cited_paper":"/paper/2502.01876","citing_paper":"/paper/2608.13026"},"observation_digest":"sha256:14b3c8f30cdaf53e04a780af727b5a5d105c994615ce95fe3203a278f68cb105","observation_id":"e5a35949-7b26-4bf3-b165-64b8ebb71333","resolution":{"observed_at":"2026-08-15T18:21:33.975739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01876/citation-record","integrity":"/paper/2502.01876/integrity","json":"/paper/2502.01876/citation-record.json","paper":"/paper/2502.01876"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.837280Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.837280Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:328804f795ce38039309bd8b61b9881cc1ab96e694c98f8723e13c94aa3748ac","observation_id":"a9e2aed3-f7cb-4920-b02b-d9226a645ef8","resolution":{"observed_at":"2026-08-09T14:19:51.837280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.172628Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":"a68b4796-e032-4e52-99af-89ef337a2ced","year":2011},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.842071Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:acaca13562ff872fe7a88b46af3230316a2bfe59138c2951395981898ad82639","observation_id":"eeb90841-1345-4e41-b206-70885f44a7a9","resolution":{"observed_at":"2026-08-09T14:19:52.176914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.162220Z","title":"Near-optimal discrete optimization for experimental design: A regret minimization approach","venue":null,"work_id":"889f042d-cc41-4d03-b519-b9723f0b157d","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.845372Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:2b6f5022259bc1155cc6f82cd7aa744d803dc2cbd10239c08ea705ca146c1b86","observation_id":"48bb65b3-5523-46c3-8f38-e793d7315b3d","resolution":{"observed_at":"2026-08-09T14:19:52.166256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.150910Z","title":null,"venue":null,"work_id":"3308a3de-e1fd-4f09-82af-543501d98ed2","year":2002},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.848793Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:77fc4639213c67784f13d08d5491b036c9d6aaf5afa2993e66f62beb1a35204c","observation_id":"797df648-711a-4078-b2ba-0d730ef58bd0","resolution":{"observed_at":"2026-08-09T14:19:52.155293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.138517Z","title":"G., Osband, I., and Munos, R","venue":null,"work_id":"e6e8b449-fa6a-41f4-b279-17ddeaeb9b8f","year":2017},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.852301Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:6ba0f4d9947daef2cd6264da174c920fac124ed39efad907bb523de44e125af1","observation_id":"047d5f60-4c25-45bc-98ea-aad9dcd95919","resolution":{"observed_at":"2026-08-09T14:19:52.142619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.126954Z","title":"and Sundberg, C.-E","venue":null,"work_id":"1b138055-b143-44dc-aaaf-a5d0200676cb","year":1979},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.855536Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:cdd2dcffc211affd341a54ee19fa06f90c4049eb4f3438e690db1cb82d4d12ef","observation_id":"f64a0e19-359e-4ce6-949e-26d36f838ad3","resolution":{"observed_at":"2026-08-09T14:19:52.131058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.114689Z","title":"On the theory of reinforcement learning with once-per-episode feedback","venue":null,"work_id":"0d6e9e9c-7f1c-49c2-b2ed-199f791f242e","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.859125Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:af64e722ff153b7995b1fa67c3769be6c1b83220cd021ad216585a07feb32db9","observation_id":"9708ab51-edfd-4bf4-b011-f37a9bdfb6ae","resolution":{"observed_at":"2026-08-09T14:19:52.119563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.103455Z","title":"Unifying pac and regret: Uniform pac bounds for episodic reinforcement learning","venue":null,"work_id":"a321201c-e2c4-457b-9098-4593337d5e38","year":2017},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.862300Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:afcf4446731717bddfc4363ef7bd94c92b4ba340b7d8bb4f7c499c8f0eda02a6","observation_id":"4254ac76-f449-49fa-b2f2-080697f08db9","resolution":{"observed_at":"2026-08-09T14:19:52.107444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.092900Z","title":"Reinforcement learning with trajectory feedback","venue":null,"work_id":"36ffa4ae-9b42-4aef-a361-03793e4d63f1","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.864992Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:bde24df127e53050bd0cfa4129b61bb48e7d61bf2aed706601734654b5bc8365","observation_id":"e906830f-dac6-4f56-9ed3-365145e617dd","resolution":{"observed_at":"2026-08-09T14:19:52.096493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.868220Z","title":"Improved optimistic algorithms for logistic bandits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.868220Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:ddf920157d912793d80c9fcc99c1867095a87ee3665228972ab0f0b3ed8ed997","observation_id":"fb8f7803-616b-4706-98c9-9f1248569426","resolution":{"observed_at":"2026-08-09T14:19:51.868220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.077375Z","title":"Parametric bandits: The generalized linear case","venue":null,"work_id":"55f9d9c5-3e55-434b-b4e0-0d35b08bac64","year":2010},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.871243Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:d5c457d2dac42e4e866f209ed7d8bbdda4875b5cd322d9cf03c3c09a98913463","observation_id":"d7d7eccb-65ee-42ee-bcd1-d734a6f62da8","resolution":{"observed_at":"2026-08-09T14:19:52.080447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.067037Z","title":"Harnessing causality in reinforcement learning with bagged decision times","venue":null,"work_id":"65bb29a4-0cb8-4a45-b48e-ce96d67c8c6b","year":2025},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.874352Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:c2a949bf044432ca367929a215c692ddbab0703456e01044afd812ef581583ec","observation_id":"a9985149-adc6-43e9-91ed-5dadc67c580c","resolution":{"observed_at":"2026-08-09T14:19:52.070439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.055068Z","title":null,"venue":null,"work_id":"e29c22a9-1805-4211-84c8-96bdbdc75a1e","year":2013},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.877211Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:02a6ae9b5ec06400f626aa7a7042aa9cba969ba3d58e913692e29c1b329631d9","observation_id":"c2cb0f95-f8d3-4aef-9dcf-5b58cf0598e5","resolution":{"observed_at":"2026-08-09T14:19:52.058986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.044735Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"f99967a5-d029-4fb6-8862-fe02f1cb512d","year":2010},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.879915Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:fcdccf53003ea1758c05c722e4f961ed6d8931292a6a03bf54a0d5ee31097d70","observation_id":"d422c481-9aa1-411d-8d41-79dc6dd9e9cd","resolution":{"observed_at":"2026-08-09T14:19:52.048612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.035315Z","title":null,"venue":null,"work_id":"b05da6ba-710a-4e9d-aa28-b89c0925bb1e","year":2018},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.882770Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:b0bf5dac789c4e5c7bc0ac5f49635feb67858dc98ebe126f2cc149830e6c2b21","observation_id":"5b0bfe69-5799-4b8a-8fd0-7f183172296f","resolution":{"observed_at":"2026-08-09T14:19:52.038642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.025679Z","title":"and Hutter, M","venue":null,"work_id":"b48354f5-d4c9-4671-b48f-2963e5396491","year":2012},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.886343Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:e8a27369d5da14b76aafb8216d795ab3e9cf8a1d876529e44b38cd1050d09143","observation_id":"b5dad29f-7bf6-47e8-92c7-26568c55f415","resolution":{"observed_at":"2026-08-09T14:19:52.028471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.015699Z","title":"and Massart, P","venue":null,"work_id":"1e58495a-76db-40ff-9bc7-31ff582a0ee1","year":2000},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.889347Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:7ee32378e6a2755d8e31805a9c45a7c4d370dda47aa3410f890f87f508254283","observation_id":"9be24f8c-4c6a-45fe-b684-70e86e12cc16","resolution":{"observed_at":"2026-08-09T14:19:52.019473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.892457Z","title":"D., Jonsson, A., Kaufmann, E., Leurent, E., and Valko, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.892457Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:c708d3d522ff78c5b6629ff13e4f87e87f3482eae3d2a384beac25581353a72a","observation_id":"22347b28-8b4a-44a4-84d6-ac0ff433e6ce","resolution":{"observed_at":"2026-08-09T14:19:51.892457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.000580Z","title":"and Moore, A","venue":null,"work_id":"bdb3d190-35f9-4fa6-8646-5d19bb86d37d","year":1999},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.895685Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:ec5bf1ed42ec80dce0c068ce6d953cd8a99a9e572b5830147eb19687f39d38d3","observation_id":"efd83852-8ee7-485f-a728-2325face270d","resolution":{"observed_at":"2026-08-09T14:19:52.003308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.991848Z","title":"Optimal design of experiments","venue":null,"work_id":"8a47b517-272e-46fc-bdd5-9574d3bed53c","year":2006},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.898605Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:3b2f13d1ed7829909b65623ed095ce562a82159b7fb9f05e886134039dae3539","observation_id":"05dfcaf2-1f5b-4aa8-8b19-d3ae9b83aabb","resolution":{"observed_at":"2026-08-09T14:19:51.995256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.982737Z","title":"Self-concordant analysis of generalized linear bandits with forgetting","venue":null,"work_id":"b1208317-6072-4684-a49c-9c1d991784df","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.901392Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:3621e0b3442ee64b49a8ff829e82de2bee9bea120b5ceb6d3bf271744436deaa","observation_id":"f4451481-f3ee-475b-82b5-6f603bcb7e04","resolution":{"observed_at":"2026-08-09T14:19:51.986161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.904455Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.904455Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:134404af719408062d586c2205d9a726115bbf6f929760f2eadfe89f7866cfcc","observation_id":"19dcb54f-00ab-46af-96f0-463ae0cb0835","resolution":{"observed_at":"2026-08-09T14:19:51.904455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.966452Z","title":"Reinforcement learning from bagged reward","venue":null,"work_id":"80af8c21-5d17-4a28-9c37-89118bdcc749","year":2024},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.908053Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:14b21ec7fc81150ce414e2b3faf7da66d42dbcd907f7bd97b1eb5c9c8f2d92e2","observation_id":"ed638af5-d215-4e19-996b-97ec7b8aa83e","resolution":{"observed_at":"2026-08-09T14:19:51.970970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.911511Z","title":null,"venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.911511Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:43318329ab9debb6522557f5ab1081fe8624be8ad238187d200106517ad58c8c","observation_id":"84586d59-6cec-4806-a0e8-c061cd2a6dd2","resolution":{"observed_at":"2026-08-09T14:19:51.911511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.951163Z","title":null,"venue":null,"work_id":"90fd268a-7db6-4cd2-a00b-2b61abb18fdc","year":2015},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.914853Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:c69a2e3ff6ef4f04770844b35916e06666f27fd64a3cc573bd9bf3d6ee1703d9","observation_id":"4cad5ac9-f212-46e7-903c-f6f62a6953da","resolution":{"observed_at":"2026-08-09T14:19:51.954438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.939725Z","title":"and Brunskill, E","venue":null,"work_id":"abb70663-4a03-4c0c-ac7d-2308fbf44816","year":2019},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.917733Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:0916cdead8f587eccddfcd684954357a0eb53c412124e2b87e7cf04d4e4d9a02","observation_id":"3bc721f4-5633-47d3-8fc7-93a12b879514","resolution":{"observed_at":"2026-08-09T14:19:51.944380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:36:30.508913Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2502.01876."}