{"as_of":"2026-08-10T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e53d533bc01dc6e79edd367ec0fb58fe26e5d506968a26ac26e5e95d0f38cf5c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:57:48.357851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:58:02.852348Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T20:57:48.357851Z","title":"Hao Bai, Yifei Zhou, Mert Cemri, Jiayi Pan, Alane Suhr, Sergey Levine, and Aviral Kumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.15760","last_updated":"2025-02-13T18:55:14Z","snapshot_observed_at":"2026-08-07T22:34:53.289352Z","submitted_at":"2025-02-13T18:55:14Z","title":"Digi-Q: Learning Q-Value Functions for Training Device-Control Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T20:57:48.357851Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2502.15760"},"observation_digest":"sha256:b59d397caf355e65c1e0d17b6578c909394925c32580c5aec4cd4768d690aead","observation_id":"c7ef4e4a-c011-4d6e-bb97-19aad46099f6","resolution":{"observed_at":"2026-08-07T20:57:48.357851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":"2311.18232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-07-03T10:58:02.852348Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models","venue":null,"work_id":"bad1baad-5c3f-4456-ac96-29c8f5e78bfb","year":2023},"citing_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:16.528682Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2503.01785"},"observation_digest":"sha256:47cf9ce8be47ba25d4948c94bd5247539951d2700133ddb3bd624156505ea874","observation_id":"af1a829c-1c05-4013-b77c-5f4d2339970f","resolution":{"observed_at":"2026-05-13T22:16:16.572195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T12:08:59.541246Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models.arXiv preprint arXiv:2311.18232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:59.541246Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:d6f6e6a2c763beab8971a9b371449dcf45e8b8cfe8420e2338c8e7dbb95c2fbd","observation_id":"a042abfe-c539-4c27-a6c1-e58591cbdc71","resolution":{"observed_at":"2026-08-07T12:08:59.541246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T11:32:30.490860Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models.arXiv preprint arXiv:2311.18232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-09T00:47:31.746531Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:30.490860Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:b18ebf1495949bb50c7176ea6bc23011b2c734117e434a1bbd138f514efb813c","observation_id":"4ef9d1d0-0259-4636-8775-80a7ff65f737","resolution":{"observed_at":"2026-08-07T11:32:30.490860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T10:51:57.917864Z","title":"Hallmonster","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04098","last_updated":"2025-06-10T13:14:14Z","snapshot_observed_at":"2026-08-09T13:12:42.388209Z","submitted_at":"2025-06-04T15:55:27Z","title":"TextAtari: 100K Frames Game Playing with Language Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:57.917864Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.04098"},"observation_digest":"sha256:d8638a22031145e57dd033edf4f86e55ba153486531d3d571fd42dff9ee1db62","observation_id":"ee65c8b9-1501-46a0-842b-8bbb96af0cdf","resolution":{"observed_at":"2026-08-07T10:51:57.917864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T00:31:36.028658Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models.arXiv preprint arXiv:2311.18232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.028658Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:0ffa287224e8781cfde829739a7953a75ff3dca15acc79578ad645a421b32336","observation_id":"a9c0a123-1458-4ec2-ad46-403029fe2937","resolution":{"observed_at":"2026-08-07T00:31:36.028658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T00:24:23.916722Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:23.916722Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:07c1d8d8f3bcd4a3c7e006adee2e3628ac027f7181154ea55d649d1462bf18d1","observation_id":"bb8ea895-684c-4635-99f3-d9721e5a0e1a","resolution":{"observed_at":"2026-08-07T00:24:23.916722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":"2311.18232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-07-03T10:58:02.852348Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models","venue":null,"work_id":"bad1baad-5c3f-4456-ac96-29c8f5e78bfb","year":2023},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:783f154d8598719a3b37b302a4d85e8ead38ffb686932f9169cdff5b7627387c","observation_id":"e37befca-cad7-4099-b173-2bd61a4c94f2","resolution":{"observed_at":"2026-05-16T22:43:37.965011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":"2311.18232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-07-03T10:58:02.852348Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models","venue":null,"work_id":"bad1baad-5c3f-4456-ac96-29c8f5e78bfb","year":2023},"citing_paper":{"arxiv_id":"2603.03197","last_updated":"2026-04-12T16:48:44Z","snapshot_observed_at":"2026-08-03T05:43:55.769983Z","submitted_at":"2026-03-03T17:52:39Z","title":"Specificity-aware reinforcement learning for fine-grained open-world classification","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T16:44:47.866126Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2603.03197"},"observation_digest":"sha256:84542ba7fba553f020cfd5ee9406037b6bdca12e6ad241835a8c5ae695df6ad4","observation_id":"c880f21b-7a36-4f16-9e8d-d49f9c34a51f","resolution":{"observed_at":"2026-05-15T16:46:17.915040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":"2311.18232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-07-03T10:58:02.852348Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models","venue":null,"work_id":"bad1baad-5c3f-4456-ac96-29c8f5e78bfb","year":2023},"citing_paper":{"arxiv_id":"2604.21827","last_updated":"2026-08-07T01:36:12Z","snapshot_observed_at":"2026-08-10T07:09:19.045381Z","submitted_at":"2026-04-23T16:18:10Z","title":"Alignment has a Fantasia Problem","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-09T21:37:54.545865Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2604.21827"},"observation_digest":"sha256:32c4b510a82dd9f030ac5732f2a35af2a726285342607aa9023ff1749109af55","observation_id":"2e7e27cf-c304-4a0e-9a5a-831f8cd370be","resolution":{"observed_at":"2026-05-11T14:31:07.544716Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":"2311.18232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-07-03T10:58:02.852348Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models","venue":null,"work_id":"bad1baad-5c3f-4456-ac96-29c8f5e78bfb","year":2023},"citing_paper":{"arxiv_id":"2604.23838","last_updated":"2026-04-26T18:45:31Z","snapshot_observed_at":"2026-08-02T18:30:10.398959Z","submitted_at":"2026-04-26T18:45:31Z","title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:33.914193Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2604.23838"},"observation_digest":"sha256:3ddd381724fcea2ea8e2d0c4be6fc80be4a0dc88255feed43623b35b4ecdf0ca","observation_id":"7e80a263-9c4e-46dd-9812-ae94e2c3f787","resolution":{"observed_at":"2026-05-11T21:11:11.550271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":"2311.18232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-07-03T10:58:02.852348Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models","venue":null,"work_id":"bad1baad-5c3f-4456-ac96-29c8f5e78bfb","year":2023},"citing_paper":{"arxiv_id":"2605.14558","last_updated":"2026-05-14T08:33:02Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:33:02Z","title":"Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T01:46:24.724553Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2605.14558"},"observation_digest":"sha256:5b72ea65b4650c5e2df1ad2d88b97dc4a26346fccd57962a7dfe05c3ea941305","observation_id":"af114a8d-6009-4eed-91da-26b6023ed2bb","resolution":{"observed_at":"2026-05-15T01:48:28.538526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":"2311.18232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-07-03T10:58:02.852348Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models","venue":null,"work_id":"bad1baad-5c3f-4456-ac96-29c8f5e78bfb","year":2023},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:e71a90970d5719cf6c2d3d86e548e0462d012f90691db44a0bb9443a9a063e07","observation_id":"1490a1fc-f5e1-4023-b042-81771be9314e","resolution":{"observed_at":"2026-07-03T10:58:02.854176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2311.18232/citation-record","integrity":"/paper/2311.18232/integrity","json":"/paper/2311.18232/citation-record.json","paper":"/paper/2311.18232"},"outbound":[],"paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2311.18232."}