{"as_of":"2026-08-10T03:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a18d1d5e70e838a530b9b5a7bef71fc95545759f5cdd2c762168b02b9f089b0","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:20:56.723685Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T06:44:28.552513Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:47:27.135925Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"cited_work":{"arxiv_id":"2508.10839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10839","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcedlanguagemodelsforsequentialdecisionmaking","venue":null,"work_id":"72c8cbc8-e55a-45fa-b6de-ce87fd0cf0d6","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:24.844859Z"},"links":{"cited_paper":"/paper/2508.10839","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:49c8e20446b95302937ad23486ae96ceee2f04a68dfe91017629b375fd09eba0","observation_id":"759d0bba-280a-4393-9ad9-cc3baaeb6ec2","resolution":{"observed_at":"2026-05-12T03:26:19.011453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"cited_work":{"arxiv_id":"2508.10839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10839","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcedlanguagemodelsforsequentialdecisionmaking","venue":null,"work_id":"72c8cbc8-e55a-45fa-b6de-ce87fd0cf0d6","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:28.552513Z"},"links":{"cited_paper":"/paper/2508.10839","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:d743550d20fe7d1f1b96f4f8af56e5c4b00dcd2dc3d2b4404cb96d24163b01e8","observation_id":"8bf19e1c-060b-42d3-80d1-189e0a0ccc6c","resolution":{"observed_at":"2026-05-13T06:47:27.138826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10839/citation-record","integrity":"/paper/2508.10839/integrity","json":"/paper/2508.10839/citation-record.json","paper":"/paper/2508.10839"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:00.322980Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":"1da8ad3b-c84f-4740-9f37-d8c6bdf6e6e1","year":null},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:53.559913Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:cae8a2d416e24d306d5557e6b33c1a48a1a5d00ed7bc80e993ef5c8955f5bd53","observation_id":"cc974d6f-2720-497d-8179-7b6803162c93","resolution":{"observed_at":"2026-08-05T20:21:00.378253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:53.598487Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:53.598487Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:a1994c70770f6d51e860d6a138d25b24a3ccf3571f4adcdcf758d64266c8f7b6","observation_id":"6786b4fd-cb1d-4dfe-8e02-4f79bbaabca2","resolution":{"observed_at":"2026-08-05T20:20:53.598487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:53.664054Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:53.664054Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:e97fd7afd3d6310c63371ff1509863bf3e9854fb1ebb1d6168b7d338b3fb16f2","observation_id":"9f7e173b-2edd-4965-82cb-0502505ecd5f","resolution":{"observed_at":"2026-08-05T20:20:53.664054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:00.141732Z","title":null,"venue":null,"work_id":"4cae87bc-5de8-47e6-b9a3-7c6de746c738","year":1998},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:53.739760Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:28b485f7838072669571680ebf7dabbe9cd97850be70c6dfce15e77b46ed05a1","observation_id":"a85edd25-c227-4cdc-a376-494d2f734fb4","resolution":{"observed_at":"2026-08-05T20:21:00.200912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:20:53.799169Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:53.799169Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:442fb5bf0bb27f43c3f767c43e7a6ac5515c7ec7217d2984169e6526503a86bf","observation_id":"fe43891f-efe5-4332-88fd-ba8d3b1a22d2","resolution":{"observed_at":"2026-08-05T20:20:53.799169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:00.012967Z","title":null,"venue":null,"work_id":"54e487b4-379c-4752-9158-b1d225a7d6b4","year":2016},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:53.864907Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:f80ff395a894485718a7db3ab35ed9780ea10011ace6c164597921382040e566","observation_id":"211b3b15-0822-47f1-a202-816c7a2cd241","resolution":{"observed_at":"2026-08-05T20:21:00.069380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:59.883037Z","title":null,"venue":null,"work_id":"1e6c54cb-ca29-4545-ab3d-5196e85ec864","year":1988},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:53.936107Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:f42bfbd9fd3201c67e9ab858ee51816c01d6c6db39973f09bf19eac9a18f2fdd","observation_id":"6331ee09-c3a0-4477-8cb5-3373dce81642","resolution":{"observed_at":"2026-08-05T20:20:59.923308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:59.758064Z","title":"A.; Bernstein, D","venue":null,"work_id":"5919ad42-9f58-42bc-852e-fba9b2811b32","year":2004},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.029675Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:919a7306a148aed6f2d1313f5e154c5221bf162c6cf8ec7293b9390d85baa3d8","observation_id":"a35cd3c0-c1b6-4e4b-bdbb-680e44d431d2","resolution":{"observed_at":"2026-08-05T20:20:59.819666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-08T22:57:04.484148Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11651","snapshot_observed_at":"2026-08-05T20:20:54.083020Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.083020Z"},"links":{"cited_paper":"/paper/2501.11651","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:c6482737da5626d453041b5f79132803eba983701fbe99a361a1909c4138fa45","observation_id":"c16c6a00-d1fe-4f2f-a93f-369528e211ca","resolution":{"observed_at":"2026-08-05T20:20:54.083020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:59.598532Z","title":null,"venue":null,"work_id":"1c216d68-4c63-4833-a73c-39e5f5ab2790","year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.126520Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:5f13bbf7e54a1d161b1981e68caf2d31ec6841bca00dba4879e16157a8b1e678","observation_id":"8b7cefc6-3ed0-4b60-8b31-63ef294136ee","resolution":{"observed_at":"2026-08-05T20:20:59.658999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:59.489517Z","title":null,"venue":null,"work_id":"039071bd-485a-4e7d-9033-332c81d37013","year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.236148Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:5f41b693cdafc36efba10ef32a72fc22c0917e3a26e2c27106ccafa0222de7ae","observation_id":"24b0cb18-55f0-4650-b89c-637c4f8ce916","resolution":{"observed_at":"2026-08-05T20:20:59.551565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:59.379449Z","title":null,"venue":null,"work_id":"b677447a-c00d-4072-995c-2783728e06b8","year":2019},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.301771Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:aaaeeb18ce0bc7e55df98482b3bcb5742ce875f71ad2638f394a6e26dee9d522","observation_id":"928fb816-b6c9-4941-9b71-324f10ca7d27","resolution":{"observed_at":"2026-08-05T20:20:59.435228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:59.203060Z","title":null,"venue":null,"work_id":"bde3bc99-5a0f-4cc9-b332-9c8aae5fe931","year":2016},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.361663Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:d1389ba16147480ff52d4a4cbff13d3bc152ce882cd6784acb01451323cf7b3a","observation_id":"8a8570bd-8a71-442c-b15f-4fe34a1b0797","resolution":{"observed_at":"2026-08-05T20:20:59.288591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00820","last_updated":"2025-05-01T19:23:50Z","snapshot_observed_at":"2026-08-07T15:57:16.714748Z","submitted_at":"2025-05-01T19:23:50Z","title":"HMCF: A Human-in-the-loop Multi-Robot Collaboration Framework Based on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00820","snapshot_observed_at":"2026-08-05T20:20:54.486456Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.486456Z"},"links":{"cited_paper":"/paper/2505.00820","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:d5852816994c8c602c4aa07c44e5cefcaf1faf22273857ed8c5a69831667821a","observation_id":"d9191b20-4cca-4422-824f-2d124ffdc844","resolution":{"observed_at":"2026-08-05T20:20:54.486456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T20:20:54.531721Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.531721Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:ed381874f3d2185fa15a7442dce7d63c74c467450eec7f25110efec181127ea6","observation_id":"a12a504d-2e2d-4c62-81a3-dd81429bcd31","resolution":{"observed_at":"2026-08-05T20:20:54.531721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19741","last_updated":"2024-07-12T11:44:33Z","snapshot_observed_at":"2026-07-06T18:38:21.977142Z","submitted_at":"2024-06-28T08:28:38Z","title":"ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19741","snapshot_observed_at":"2026-08-05T20:20:54.604148Z","title":"E.; Wan, Y.; Yu, H.; Grosnit, A.; Gonzalez-Billandon, J.; Zimmer, M.; Wang, J.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.604148Z"},"links":{"cited_paper":"/paper/2406.19741","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:81888dc214386e060a908bbb257c16e703d41f3e61435ad8092aa0d37900f30f","observation_id":"a2b58967-429c-4a92-99c2-94d717356c35","resolution":{"observed_at":"2026-08-05T20:20:54.604148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:59.031653Z","title":null,"venue":null,"work_id":"6186bcb1-9b10-4c85-8b3d-2042a16d0829","year":2003},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.684439Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:dc3c5804fef5b3a894b84e05a26aafd65fe0e44640cb333b0c9b64d1311e8ec9","observation_id":"e3cdc1d5-b022-4c21-801d-868b5f0f3c3a","resolution":{"observed_at":"2026-08-05T20:20:59.108432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T20:20:54.757877Z","title":"P.; Perelman, A.; Ramesh, A.; Clark, A.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.757877Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:5cfdbbad1aaecbff304968030a297ce2d8ffa8a3b80efb377174a00330e87107","observation_id":"5d520b1a-4fe6-4431-a27a-8e6ab58e5c4c","resolution":{"observed_at":"2026-08-05T20:20:54.757877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:58.860309Z","title":"L.; Mishkin, P.; Zhang, C.; et al","venue":null,"work_id":"de84d6ba-6860-4ee1-983d-0f945112744b","year":2022},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.857337Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:8e081223c579633d46a4a7799369eb41c3f8687118cbd93c5b0d225afa240ce3","observation_id":"292b3ed9-5318-4fad-9e5d-8a22f21c988e","resolution":{"observed_at":"2026-08-05T20:20:58.945154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:58.681795Z","title":"E.; Zhang, K.; and Kim, J.-K","venue":null,"work_id":"8d1a1f9c-b6e7-479c-97d5-32f6ea467bd3","year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.904478Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:3d0ded02bd53425190bf391a6be13949a9907ad5c9e0285b9f3ed4b46c72c542","observation_id":"2086a6f9-418d-40f4-b5a4-18d3fbaad7c4","resolution":{"observed_at":"2026-08-05T20:20:58.761059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T20:20:54.970183Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:54.970183Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:a9e78f35b59aa4bebb7cc7a8b43f16143cc523cea3ef0709a68a2741630709a2","observation_id":"71ab2df3-6d4c-4faa-acd8-83a998f305dd","resolution":{"observed_at":"2026-08-05T20:20:54.970183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:58.543502Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":"68365b61-0b98-4fc7-9a40-0c7d14794cc7","year":2023},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.087607Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:4cb7f716481622240eb0b2bd382598a91efae94666a7d1f3369a0788ac209a5a","observation_id":"0f2007e4-d43b-4ece-837b-84e0da47fcc6","resolution":{"observed_at":"2026-08-05T20:20:58.602951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:58.318313Z","title":null,"venue":null,"work_id":"a58cfb7c-9aa2-42c2-9faf-4740ea2af80b","year":2016},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.134546Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:e6de0a3d847640ed13af1163099985a260dc62256e9ddedbfc10405b9fb1375b","observation_id":"a9c1cf07-8a3e-405c-80ad-0554d94eb40b","resolution":{"observed_at":"2026-08-05T20:20:58.427076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T20:20:55.288861Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.288861Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:3a064fceaf38aa2d05bc3803d037c7ebf4e50548b834dada18422510e0057ae3","observation_id":"a4e8f578-d9bd-4c4e-9317-a8bbb40a3c05","resolution":{"observed_at":"2026-08-05T20:20:55.288861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T20:20:55.391055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.391055Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:4b9e3ab4b594ca69c91fa3f1f16777193bba0f261f3247bb894f3acdf9126e0b","observation_id":"01358c47-70f4-42e0-908f-653b73d2922d","resolution":{"observed_at":"2026-08-05T20:20:55.391055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:58.143082Z","title":null,"venue":null,"work_id":"88f364a7-a09b-4f12-84e7-5ad476e0ad99","year":1953},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.492438Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:44370d1c162f9906c40b0508697c18dd77f91c22732f59b6a4424c4f2ab28613","observation_id":"c3d96199-7a37-41cf-8670-755e8fc51ade","resolution":{"observed_at":"2026-08-05T20:20:58.232517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:58.002680Z","title":null,"venue":null,"work_id":"1aba6148-ffbc-4b25-b7cd-b141549c7887","year":2023},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.589226Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:461159850bc9b7add164b7927bd31cfb50ddc216edd50a360e43ed6170742aad","observation_id":"9bbcb265-1e03-4565-aa61-613f49a04724","resolution":{"observed_at":"2026-08-05T20:20:58.085462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:57.802571Z","title":"S.; and Barto, A","venue":null,"work_id":"71f05018-6a37-429e-8ca3-e4521bf8bf77","year":2018},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.665050Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:38ac75ee7ccb12f92f1143c80e6eb8fe18efdf229d2d4c0f554d2651ebf0614d","observation_id":"7685cd1e-7d05-46b8-90dd-410be04f9488","resolution":{"observed_at":"2026-08-05T20:20:57.893391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06351","last_updated":"2023-12-11T12:56:40Z","snapshot_observed_at":"2026-07-06T16:59:48.092719Z","submitted_at":"2023-12-11T12:56:40Z","title":"Evaluation of Large Language Models for Decision Making in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06351","snapshot_observed_at":"2026-08-05T20:20:55.719918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.719918Z"},"links":{"cited_paper":"/paper/2312.06351","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:26d046916ce99518412732e6a4409ba7221934001053c0efda9fcc0e77953465","observation_id":"abc864c5-5297-4f6a-9b4b-d9f0d577812a","resolution":{"observed_at":"2026-08-05T20:20:55.719918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T20:20:55.795118Z","title":"U.; Cola, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.795118Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:d5f53d2b940d1e1fc574bd830ac65d83fc6f9d4a01fec5747c7b7d1edf26eeb5","observation_id":"89f3a3cf-3e89-4dfa-88ac-74780d480c2f","resolution":{"observed_at":"2026-08-05T20:20:55.795118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:57.680626Z","title":null,"venue":null,"work_id":"cf45426d-24af-411b-8695-3ecff92430bb","year":1999},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.912306Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:4dd696b3242cc754dc6210f2b06dc557b698733b7dca0bc48caf0480fa8efd3d","observation_id":"7dd9dd30-5aab-4cc1-9ac1-a8b1a95dda1a","resolution":{"observed_at":"2026-08-05T20:20:57.761463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:57.515429Z","title":null,"venue":null,"work_id":"4c7db961-d1ad-4eea-ad81-3bfb015a8110","year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:55.962220Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:32b72650f79a90259423edd72debc048adb94b625a52e4df3937dd00160bc9cb","observation_id":"dc262115-c184-4fe5-b0d6-36fa21ffa1a7","resolution":{"observed_at":"2026-08-05T20:20:57.616584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-05T20:20:56.054801Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.054801Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:2943863d9742a2e64e002406e0f01fcf38632b6225e52da8fdbaf282664af1a1","observation_id":"5f42ce11-bc78-47e2-af30-ec53f906a553","resolution":{"observed_at":"2026-08-05T20:20:56.054801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T20:20:56.119890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.119890Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:bb9a970d3c38e8e501a4e1335d53ccfd38c0235e3aa2841ae564ad7d63304d0c","observation_id":"8aaccf3a-20ba-495a-88f2-cf358bd7790b","resolution":{"observed_at":"2026-08-05T20:20:56.119890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:57.353609Z","title":null,"venue":null,"work_id":"3dd19d6d-c93e-43ef-ba95-b1c3ab3c3a16","year":1992},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.176557Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:3dc06e4bc98fd0d8fc5c6e9b9376e94a313d14bc1f109b97a8d8c358b68beac1","observation_id":"7aa594cb-4c8a-478f-ae57-3b1519b1ff55","resolution":{"observed_at":"2026-08-05T20:20:57.427388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T20:20:56.253277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.253277Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:e55ac7430b2aa47794d5428fa46a3ad01efea965dd5e9020b827556211b5397d","observation_id":"3486c8ef-1a95-45c4-9c0e-dbe2f1a955d4","resolution":{"observed_at":"2026-08-05T20:20:56.253277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T20:20:56.318703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.318703Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:2554061beabdd389228865669138896df55b637459dccb8344b6677d3d523163","observation_id":"c039a950-0021-4e08-ad64-583bfbda2dcc","resolution":{"observed_at":"2026-08-05T20:20:56.318703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02485","last_updated":"2024-02-17T05:27:56Z","snapshot_observed_at":"2026-08-02T22:53:12.613357Z","submitted_at":"2023-07-05T17:59:27Z","title":"Building Cooperative Embodied Agents Modularly with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02485","snapshot_observed_at":"2026-08-05T20:20:56.360454Z","title":"B.; Shu, T.; and Gan, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.360454Z"},"links":{"cited_paper":"/paper/2307.02485","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:8220de8b8db2a0b4a746ab22dc71f4c12318d927a9a09171765cb019a004160c","observation_id":"480a7a2d-b987-4bcd-b671-16d83a504fa6","resolution":{"observed_at":"2026-08-05T20:20:56.360454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T20:20:56.475462Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.475462Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:cb4ac07ee995aeaa57f7fe4dd549fde87fde9a409d2c1f5843a9ae8ba12b7e49","observation_id":"f19ef7d3-1b2c-4a0d-9504-ef08ea9118b9","resolution":{"observed_at":"2026-08-05T20:20:56.475462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-05T20:20:56.530570Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.530570Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:2ef11c53ea71ca6c0d6dc788363924758b878ec74d5ea6c1671ee8982961c3ad","observation_id":"5bed92c2-63fe-4f30-be1e-1285c0b08239","resolution":{"observed_at":"2026-08-05T20:20:56.530570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-05T20:20:56.616695Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.616695Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:d37d4a0c157d756ecf3c99d4067caa465fd29a56867281b3fc89d93e5eb9eeb8","observation_id":"50ee1f6f-2450-4e74-b775-ef523dadca71","resolution":{"observed_at":"2026-08-05T20:20:56.616695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:57.250417Z","title":null,"venue":null,"work_id":"a8328a74-8bbc-42d4-96ee-e9f663dc19c7","year":2024},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.693887Z"},"links":{"citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:cf88d07cef0874c4fdabd3e57b8675137bb396ccd972d7e33978079501816360","observation_id":"34b45a5f-aca1-4bfe-a42f-8cc1569ff09b","resolution":{"observed_at":"2026-08-05T20:20:57.294600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T20:20:56.723685Z","title":"M.; Stiennon, N.; Wu, J.; Brown, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.723685Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:4559a2afa58fb6c28e41b951b2d2c9e177d14a4977abbeab18fed5fc79a45a81","observation_id":"30982ed7-f0ed-41fd-8af0-906022070f59","resolution":{"observed_at":"2026-08-05T20:20:56.723685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T23:03:09.723616Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2508.10839."}