{"as_of":"2026-08-05T13:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8fa0ca511f59eb4bb8be9b5a4cb26d5522627e0961adc44778a3e55fa2d24fb","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:34:24.662157Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.07247/citation-record","integrity":"/paper/2605.07247/integrity","json":"/paper/2605.07247/citation-record.json","paper":"/paper/2605.07247"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yu, and Ming Zhang","venue":null,"work_id":"51c808ee-62f9-49f1-a431-a1b43e8affc2","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:6138d0591781d1851bbc3364b0c359ae9c824efc5e137ca58e6b8d894f2c457d","observation_id":"0dc5fe6c-9b8f-4f02-8066-4ff477331a20","resolution":{"observed_at":"2026-05-14T16:11:57.964740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"τ-bench: A benchmark for tool- agent-user interaction in real-world domains","venue":null,"work_id":"0dcd8d5a-2c86-4386-bbc6-ba5e28777415","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:4fa1a28f4bcc7b50f9b9a1cac0817ed79e4f64875c668afa6f9a0c69ff1eb972","observation_id":"82aea30d-b6bc-48cc-90a0-c5dffaefe32b","resolution":{"observed_at":"2026-05-14T16:11:57.946181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Userbench: An interactive gym environment for user-centric agents","venue":null,"work_id":"eb2ad92b-41e3-4ddc-aa46-cb6e4cc5b6ef","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:26e71a6c022e537eebd40f38c90d256c02225c59e6a9e5c7cdbf0160023fdd9f","observation_id":"603afbac-cb92-4d12-a2fd-ec52ad5306da","resolution":{"observed_at":"2026-05-14T16:11:57.970976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":"fcbce046-842b-4871-86d1-5af7d42c7919","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:b451969ae46134d2727ab286aa0c8b8320248779d2bc8785f061ea4604e9be02","observation_id":"6ce585e3-b4a3-4c82-9900-71bc1af714df","resolution":{"observed_at":"2026-05-14T16:11:57.942341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":"66444147-6972-4d90-b5eb-5aa318e4d528","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:5b1e204e22b6f9000d3a132046ed17bf363ae7cfde810451c0b7e2fb94718e5e","observation_id":"0f45c943-dc36-424b-84be-f4fe69daac79","resolution":{"observed_at":"2026-05-14T16:11:57.960267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ee144389-287b-464b-a1de-688236a157e6","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:a1f5b7ded33294e5921d2efd56b0f8888f345b4ad769a4914ede212256e9623b","observation_id":"19b971c7-73f8-4444-a06e-7d86a577bdbb","resolution":{"observed_at":"2026-05-14T16:11:57.978207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4a779a03-be78-4908-b4a3-7b608ccfbea4","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:4bb884df4967d1656b0358b8a30db11f655f0b717b4e58dbccd40ed8c461ea1f","observation_id":"72ae48bb-def6-4078-8b98-3993ccdc1bb9","resolution":{"observed_at":"2026-05-14T16:11:57.966764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are: Scaling up agent environments and evaluations","venue":null,"work_id":"ec70853f-d688-44d0-9381-22f4ce68713c","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:1346046c32d82e1b978aaff30db05c2b253f9dfd15db5dfb1196cce00160e32b","observation_id":"1db7ba02-1d12-4b64-ac6c-5b64d57f84f2","resolution":{"observed_at":"2026-05-14T16:11:57.976560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SWE-bench: Can language models resolve real-world github issues? InThe Twelfth International Conference on Learning Representations","venue":null,"work_id":"0c803f70-cb9a-4980-981c-0deaa09929f8","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:82cc4574d570195cf5443553758ddb58b916e451c81c724d72084095e096ea8c","observation_id":"974e9eaf-633f-4b06-b7fb-bbe85201c1cf","resolution":{"observed_at":"2026-05-14T16:11:57.950340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webarena: A realistic web environment for building autonomous agents","venue":null,"work_id":"57cd1a66-7dda-4a2f-89f2-7953a443fda8","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:25c0ed2e404a9c84304ee3cc3c596641b6166c4342b7cec56b637fc9295d61f5","observation_id":"78321067-5c46-4c9b-ab6f-1a6b3a394862","resolution":{"observed_at":"2026-05-14T16:11:57.972748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{ALFW}orld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":"e95e77d4-8a04-4a03-9312-8442380a05d1","year":2021},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:200d5f69e5eea8321bb69cd3e057e3ce20b89bd5b7aa34261a32d7c2553615ff","observation_id":"528e2ee6-228a-4353-ac17-1614dd277a94","resolution":{"observed_at":"2026-05-14T16:11:57.974710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simulating environments with reasoning models for agent training","venue":null,"work_id":"f4d0a355-7a25-4054-abfc-13ba4257635f","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:a163b0b56ae9a1c29bdef145a7b38b83b161454a25079f60b23b665ceeb5d722","observation_id":"413d3639-68bf-4462-8596-f42ce2a3219b","resolution":{"observed_at":"2026-05-14T16:11:57.956364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Envscaler: Scaling tool-interactive environments for llm agent via programmatic synthesis","venue":null,"work_id":"9e5f447f-3375-47fe-9999-1e4c3c483f78","year":2026},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:d63cc510686e58dfee5d6ef3ef232cc623983aef1080587a2b973beb3b76fd5d","observation_id":"b76d50ab-9c5b-4f6d-acc4-cc8e0bc06433","resolution":{"observed_at":"2026-05-14T16:11:57.944189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Survey of hallucination in natural language generation.ACM Computing Surveys, 55(12):1–38, March 2023","venue":null,"work_id":"d26e707d-ab18-45be-9dcf-5fab7b6166b8","year":2023},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:209eb36343e9abf758c4ec5b2438a279d4430ded99f82da86f8e345738f50941","observation_id":"ff9012a4-18be-472a-95e9-44a4dc59cd1e","resolution":{"observed_at":"2026-05-14T16:11:57.954444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":"2305.15334","doi":"10.48550/arxiv.2305.15334","metadata_source":"pith","pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gorilla: Large Language Model Connected with Massive APIs","venue":"cs.CL","work_id":"126a464a-4a73-495f-b669-de1e44aa8f09","year":2023},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:d3f95b562b6e57229bb86db0f8f4c1ce156d040718ab97f0f097bfe946aecc24","observation_id":"49589e0b-565d-4d37-a5db-d63e3aa07ff3","resolution":{"observed_at":"2026-05-11T23:22:17.488448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Siren’s song in the ai ocean: A survey on hallucination in large language models","venue":null,"work_id":"cef01e27-8907-40cd-a486-cdcd9b6d5c8b","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:2aa0f4d09ceaf0ac047c51a8a620e9240967927cfc0ab55c48233c4b6dee2fef","observation_id":"29ced906-5e7c-4a8a-8932-cfb2502f6fa8","resolution":{"observed_at":"2026-05-14T16:11:57.958335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maddison, and Tatsunori Hashimoto","venue":null,"work_id":"5e6c2a2b-8c3e-4b9a-ab9f-63a2a4ec6d16","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:239c183dbb4b321792856cb27c60cb9d5ba3a8df030b94a1dc2325c8c39828d0","observation_id":"4d36844c-9fa8-49b0-9b9b-e7dc6070fdd2","resolution":{"observed_at":"2026-05-14T16:11:57.962924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring and improving consistency in pretrained language models.Transactions of the Association for Computational Linguistics, 9:1012–1031","venue":null,"work_id":"5580d23d-e66f-4aa3-916e-99cd709485b1","year":2021},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:c75e716a32aa2830ea62067d22bad839e1c8ae4339643564e3c1502750dda655","observation_id":"65df21cc-0c48-49ae-a0ab-e9b72a46e349","resolution":{"observed_at":"2026-05-14T16:11:57.952450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Apigen-mt: Agentic pipeline for multi-turn data generation via simulated agent-human interplay","venue":null,"work_id":"25441d1d-56ce-4fb7-a46b-a267b5253ff5","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:28da0b67aa30d0541ba26bd50c186a615507873e988307945cad979b39658afc","observation_id":"fdf8c5bd-6ab7-440c-b44b-8c8134f8f6c9","resolution":{"observed_at":"2026-05-14T16:11:57.968767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer","venue":null,"work_id":"c77e8797-a4c8-4d88-86f5-c8c456ed3a25","year":2016},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:d19ada79392d72f0058a6a5409460e83110201469484c258293daacd96b2f062","observation_id":"89f1a842-2651-405d-9cb5-490caecbb8b3","resolution":{"observed_at":"2026-05-14T16:11:57.940448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive fiction games: A colossal adventure","venue":null,"work_id":"882d131f-ac3a-48fd-bc83-c12762d5bc59","year":2020},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:b2fc2987d5a49ed6f2f6d773fd410cc72aec63d1e793b4cc1536b81d717e9511","observation_id":"3bbdfb63-c875-4bff-8532-9db2d9941f93","resolution":{"observed_at":"2026-05-14T16:11:57.948014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"89b9d72c-851e-4358-a161-58bf07d6ec2b","year":2023},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:a55de18062a25f8fbcbe6a8f809c85edc751175ff7c2a093c1aba5dc29597cb6","observation_id":"ce1f80fe-575a-4ef8-91c9-560a5045bb1b","resolution":{"observed_at":"2026-05-14T16:11:57.938448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":"8a32f197-b36e-48fe-a483-8f3a28f9b72e","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:84e5420a77da91295dd47aa4ca9b7c4ce20fdfec5c995961d6adbcacb1790027","observation_id":"14771c3f-1536-4200-af16-31b536c98692","resolution":{"observed_at":"2026-05-14T16:11:57.926119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":"a9a09924-4b14-457e-a148-b09bc01f3a76","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:061c053eaee88555e5e33484ea5daf973af105052cb9c49bb0ff001f35c1265b","observation_id":"08cb15e6-43a6-4dcd-b7ce-5136aeacce23","resolution":{"observed_at":"2026-05-14T16:11:57.934653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":"91233d45-84a5-4ff5-ae44-c2b7e607e1dd","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:f6b133ed0959d28272bcd31f082373ea046d0fbe4e33dd6b8e039b36e78cdd8b","observation_id":"e65e8568-95b5-494d-a32a-5680206b9638","resolution":{"observed_at":"2026-05-14T16:11:57.930119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.383521Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"1223b23e-b5a3-4578-9216-a87906aea27e","year":2023},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:94d507dabd2cebcc95d60dc7d03b62843e7bcb486c74623c9e630d37f45a3137","observation_id":"f477d23f-871c-4b31-bba6-54a088ea2bfd","resolution":{"observed_at":"2026-05-14T16:11:57.918500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agenttuning: Enabling generalized agent abilities for llms","venue":null,"work_id":"d3bc4b77-0319-43b1-8096-37ab302921fe","year":2023},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:e108f9cf2c67b9edcf7efc72149dba12d782e16cc8b0de42e1cb75cdd6d48064","observation_id":"d0c9f1c6-2f57-44ae-90aa-3d91be73327b","resolution":{"observed_at":"2026-05-14T16:11:57.915997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis","venue":null,"work_id":"52498880-95d9-4681-bb1c-6761a3afeaa8","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:ed9aa209af83aa79116f8f35c6e82293865338fae9ed5b643cc918d55afbda01","observation_id":"542d7999-d460-4431-9779-cadb60b8884d","resolution":{"observed_at":"2026-05-14T16:11:57.936601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metatool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"a3daea7f-f1cc-4ebf-922e-fb3b8332c6e2","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:c23ad179a87fed4624cf306923ede04f1254d9b31a64876215fad4d00150f4e0","observation_id":"b70674dd-665a-4e59-8298-952bfe7ed487","resolution":{"observed_at":"2026-05-14T16:11:57.932274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"τ 2-bench: Evaluating conversational agents in a dual-control environment","venue":null,"work_id":"b8b63e6c-6741-4e58-b19e-0d73ce1baad4","year":2025},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:c2a983e6286afea291b7c2901f4a9c3889245f3ee994dfa4ebac9c976cac5f55","observation_id":"857ba90c-b839-4eb3-baee-b61a6e4ad69e","resolution":{"observed_at":"2026-05-14T16:11:57.928118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"APIGen-MT: Agentic pipeline for multi-turn data generation via simulated agent-human interplay","venue":null,"work_id":"d07cef1c-4d40-4e57-87ef-10bc9688a8b7","year":2026},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:6bfa5d5b76a3aad13ac03a8346ad2275ab1a240a14551e35866c309e69e5547d","observation_id":"86265249-c411-447d-a122-e9141e267d12","resolution":{"observed_at":"2026-05-14T16:11:57.922340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LlamaFactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":"b3a551ee-073b-424d-808f-ec8484240481","year":2024},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:b7ddc1c0f02370d155c63bf66aeaa07e5819791f23f1d64d654a59febee53628","observation_id":"1dcba389-cced-464e-a5bc-79d389089aa9","resolution":{"observed_at":"2026-05-14T16:11:57.920419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"add blocked entries for 2025-05-01 through 2025-05-10","venue":null,"work_id":"b4a11362-d5d6-41b6-ab28-dbcd15862d3f","year":2020},"citing_paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:34:24.662157Z"},"links":{"citing_paper":"/paper/2605.07247"},"observation_digest":"sha256:b65fbf111a46b8aa9d73a701f5d306f15be8ff0a9b5804a91c755cf6d077b5fb","observation_id":"1d573ee2-74af-4992-9d0c-bfc37c4dd26e","resolution":{"observed_at":"2026-05-14T16:11:57.924221Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07247","last_updated":"2026-05-08T05:08:16Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T02:38:10.326885Z","submitted_at":"2026-05-08T05:08:16Z","title":"EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2605.07247."}