{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d7cebce94850ae9f9cb31b4bbe62bfa7e7d482700461c2185b933f1d109da42","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:30:30.167398Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:02:26.081166Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:39:17.301001Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"cited_work":{"arxiv_id":"2508.10428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10428","snapshot_observed_at":"2026-07-04T00:39:17.301001Z","title":"arXiv preprint arXiv:2508.10428 (2025) 18 S","venue":null,"work_id":"e094759b-1c56-43b2-b79a-ab772f9344ca","year":2025},"citing_paper":{"arxiv_id":"2606.18950","last_updated":"2026-06-18T08:25:27Z","snapshot_observed_at":"2026-08-07T06:04:46.021695Z","submitted_at":"2026-06-17T11:32:51Z","title":"RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:26.081166Z"},"links":{"cited_paper":"/paper/2508.10428","citing_paper":"/paper/2606.18950"},"observation_digest":"sha256:8907c4158ff0d75602c9bd82d7cb8d3efab0bbd01a686dde997ee6517924ef2d","observation_id":"0b0044aa-d816-46ff-82d3-be3a138f2e0f","resolution":{"observed_at":"2026-07-04T00:39:17.302344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10428/citation-record","integrity":"/paper/2508.10428/integrity","json":"/paper/2508.10428/citation-record.json","paper":"/paper/2508.10428"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:28.708904Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:28.708904Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:171209b10485b100ad1d9a24b71794e845ce8e8292aa8f11a99a2434a4ba3a1b","observation_id":"402af738-96bf-48ea-a77c-3c528f4d0aa5","resolution":{"observed_at":"2026-08-05T20:30:28.708904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:28.792837Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:28.792837Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:65a41187107c21e6f114dbcc8442195219d4084faac5f4659e361cd4807b4fb7","observation_id":"fcfd4c6f-7986-4566-bfbd-09aa7febcc19","resolution":{"observed_at":"2026-08-05T20:30:28.792837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T20:30:28.941922Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:28.941922Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:b3ae7aa63eaae3e5f299903ac52955b751343d7041239c316d0c1c105ee56c4d","observation_id":"3ab399f5-2654-49db-b347-e4bfaeaa3917","resolution":{"observed_at":"2026-08-05T20:30:28.941922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.439387Z","title":"K.; and Johnson, B","venue":null,"work_id":"248de09d-dd1c-4be7-96d8-9251f69467f7","year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.110846Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:a63d7249c2952f44689da7680e2f9399f78b632f452e749520fd7e16c48b46e4","observation_id":"6b936859-190d-4248-bc2a-732f483af256","resolution":{"observed_at":"2026-08-05T20:30:30.442231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T20:30:29.216038Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.216038Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:792a7c19e25546df4cf8f72e57fd2318fb4ed555f6d0d7fc53c182a1a169d388","observation_id":"d7755b31-5bda-4475-bf0b-d9d04ef19bcf","resolution":{"observed_at":"2026-08-05T20:30:29.216038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:30:29.352392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.352392Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:5919d9b0bdce4f2e3fbd98e386f86abb364de43810422c66265c8c486f5fe987","observation_id":"a1b8d12e-1e9a-43ae-abf7-463dafdf8255","resolution":{"observed_at":"2026-08-05T20:30:29.352392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.430930Z","title":"L.; Yao, S.; Chen, Y.; Shen, P.; Yu, H.; Zhang, H.; Zhang, X.; Dong, Y.; et al","venue":null,"work_id":"2edff16e-01fc-4f9e-b481-9aa02d054ed0","year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.424757Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:91fd74534090e3de852411ea9fbb3ef21c56e42112a3c3adb9059dcc1b1a0711","observation_id":"a3304b1e-6bc5-4952-b5d3-00963259cf41","resolution":{"observed_at":"2026-08-05T20:30:30.433855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05348","last_updated":"2025-05-02T07:20:36Z","snapshot_observed_at":"2026-08-07T15:45:18.538913Z","submitted_at":"2024-11-08T06:04:22Z","title":"LLM-PySC2: Starcraft II learning environment for Large Language Models","version":2},"cited_work":{"arxiv_id":"2411.05348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.05348","snapshot_observed_at":"2026-08-05T20:30:30.318775Z","title":"LLM-PySC2: Starcraft II learning environment for Large Language Models","venue":"cs.AI","work_id":"c6cb7057-8b39-4a73-b572-3dfb544548fa","year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.516705Z"},"links":{"cited_paper":"/paper/2411.05348","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:77759c76ffb9119b1b4290c8534d2a7a42acd41fe8fe0d7fa161a56cb06a774d","observation_id":"36a70c36-a638-4ce1-a441-ead97bbd793d","resolution":{"observed_at":"2026-08-05T20:30:30.321803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-05T20:30:29.614571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.614571Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:6e93c8e3600cf03c43b9c0b4406ffa78417bc2de1e35a6cc09ffd8ad493868e2","observation_id":"505180f6-239f-4f55-a4c2-653ea13f0b53","resolution":{"observed_at":"2026-08-05T20:30:29.614571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-05T20:30:29.700721Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.700721Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:377d46d4d374e907e76031b86b75c3c524a03f31536a33ec1b7071e44d362f82","observation_id":"8f376d00-af2a-400e-bd75-d07db199621e","resolution":{"observed_at":"2026-08-05T20:30:29.700721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.421526Z","title":null,"venue":null,"work_id":"65509f7e-2716-4bec-9d56-a8e0583e3dc4","year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.807997Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:4ee05254310d0b1700ae46d2d90c0c688994cd3186ddc72e72f440ad6b40a58b","observation_id":"fde970f7-9348-40e1-9558-6fcb47d8a8ff","resolution":{"observed_at":"2026-08-05T20:30:30.425166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.413268Z","title":null,"venue":null,"work_id":"7c34a3e4-5c2c-44c5-94bf-fd9b0d6d7213","year":2025},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.895387Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:9a57160d1fcdc4589ca825dcd10e63a7b7ad8a2345fc61d0643d00a2989cfd14","observation_id":"f87afcd7-dcb0-4cce-b4f7-3ef77efe648e","resolution":{"observed_at":"2026-08-05T20:30:30.415893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.404735Z","title":null,"venue":null,"work_id":"9d9504fe-ba2d-47ca-9512-72098452c558","year":2013},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.990030Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:d0a02015ff85d47dfe76fa691cf03d6ea46d8542527b6207d38a941502ec2878","observation_id":"b2f2ef39-5c7f-4313-a5a7-9521dd196d9d","resolution":{"observed_at":"2026-08-05T20:30:30.407634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.090360Z","title":"S.; Farquhar, G.; Foerster, J.; and Whiteson, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.090360Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:3c89cf61f4c792ba24d524bc9898983991ab1cc29630b5cba12c4d508a8d1a6c","observation_id":"7dc2bd4a-cc3e-44b4-ab76-a4ef4532e340","resolution":{"observed_at":"2026-08-05T20:30:30.090360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00264","last_updated":"2025-04-11T21:25:02Z","snapshot_observed_at":"2026-07-06T19:43:19.201456Z","submitted_at":"2024-10-31T23:52:06Z","title":"TurtleBench: A Visual Programming Benchmark in Turtle Geometry","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00264","snapshot_observed_at":"2026-08-05T20:30:30.112631Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.112631Z"},"links":{"cited_paper":"/paper/2411.00264","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:b8046079634a828b4cb21f888ddc22fadc6d78d57e20bb3a25ee41f46f4e81f5","observation_id":"0d1c389c-55fc-44b2-a709-f66e4b0f7af7","resolution":{"observed_at":"2026-08-05T20:30:30.112631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-09T00:58:24.558416Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-08-05T20:30:30.115627Z","title":"S.; Farquhar, G.; Nardelli, N.; Rudner, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.115627Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:f1928d1e2dd5d955e3e6200f334dd94604795779da308b80491a15e7934cb121","observation_id":"0fb317f2-1174-470a-a596-89e4fb743e01","resolution":{"observed_at":"2026-08-05T20:30:30.115627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01054","last_updated":"2023-12-02T07:41:46Z","snapshot_observed_at":"2026-08-05T20:45:16.610342Z","submitted_at":"2023-12-02T07:41:46Z","title":"Exploring and Improving the Spatial Reasoning Abilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2312.01054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01054","snapshot_observed_at":"2026-08-05T20:30:30.268481Z","title":"Exploring and Improving the Spatial Reasoning Abilities of Large Language Models","venue":"cs.RO","work_id":"5ab9f85f-091e-4ad4-b8e4-7d7a66e6c4e6","year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.118412Z"},"links":{"cited_paper":"/paper/2312.01054","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:77ea3a3450920161a49cd0721dc646e13b9241c403814505d7d0a4ee61d2e517","observation_id":"f48fbc19-1b65-4b94-acd6-9684496eeb38","resolution":{"observed_at":"2026-08-05T20:30:30.273375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02442","last_updated":"2024-10-14T13:57:29Z","snapshot_observed_at":"2026-07-06T18:56:57.369673Z","submitted_at":"2024-08-05T13:08:24Z","title":"Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02442","snapshot_observed_at":"2026-08-05T20:30:30.121068Z","title":"R.; Wu, C.-K.; Tsai, Y.-L.; Lin, C.-Y.; Lee, H.-y.; and Chen, Y.-N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.121068Z"},"links":{"cited_paper":"/paper/2408.02442","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:327da727406949e9a2ec385d71490b7fa9404f807b466c6e18fe3ca6dc62fe03","observation_id":"92afc32c-3678-4e37-b21d-cb174bd43a38","resolution":{"observed_at":"2026-08-05T20:30:30.121068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.123990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.123990Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:1b4bc058bee688bf6eda44a75fc8b13ee99ed9d2c58384c28dae41b24febfc6e","observation_id":"7390fba7-1b8b-42a2-843a-1b9e285ac15b","resolution":{"observed_at":"2026-08-05T20:30:30.123990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T20:30:30.127668Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.127668Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:613aa19d69c73a84067a09ce2c43ba227643891ecbfd55759a01af33fa5da704","observation_id":"e5d87f50-03aa-4644-a248-302c63543b03","resolution":{"observed_at":"2026-08-05T20:30:30.127668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.384732Z","title":"M.; Mathieu, M.; Dudzik, A.; Chung, J.; Choi, D","venue":null,"work_id":"289acb4e-eaf9-402a-9418-bf4b5d275da2","year":2019},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.130712Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:04f9bd23c3098396636eb03a95944d749fd8250976e81c9828c536042ade4214","observation_id":"52da062c-f74c-4ed1-8a55-a8b24269c144","resolution":{"observed_at":"2026-08-05T20:30:30.388120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-05T20:30:30.133129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.133129Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:5e69b2696ddccd64ef848b59a5e40a8692872494a24c32f4822aad0773beb289","observation_id":"f63a0b5f-976e-4d20-be07-1e6fc91df16b","resolution":{"observed_at":"2026-08-05T20:30:30.133129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04091","last_updated":"2023-05-26T07:06:48Z","snapshot_observed_at":"2026-07-06T15:24:07.662207Z","submitted_at":"2023-05-06T16:34:37Z","title":"Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04091","snapshot_observed_at":"2026-08-05T20:30:30.136060Z","title":"K.-W.; and Lim, E.-P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.136060Z"},"links":{"cited_paper":"/paper/2305.04091","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:1c764caa6d0d41c7725c42c2eb601e73db38b322160fc14e92d81af06b9d251b","observation_id":"b3884b65-701e-440e-ad64-110431ccac56","resolution":{"observed_at":"2026-08-05T20:30:30.136060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01320","last_updated":"2023-10-24T12:51:28Z","snapshot_observed_at":"2026-08-05T05:05:50.021527Z","submitted_at":"2023-10-02T16:27:36Z","title":"Avalon's Game of Thoughts: Battle Against Deception through Recursive Contemplation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01320","snapshot_observed_at":"2026-08-05T20:30:30.139169Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.139169Z"},"links":{"cited_paper":"/paper/2310.01320","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:371570f4e0607d2146fd82e7b61c276a219989ce47b70636d76e390995f5a624","observation_id":"78f0f4cc-a38c-47d8-95eb-2a376f230b70","resolution":{"observed_at":"2026-08-05T20:30:30.139169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.146973Z","title":"V.; Zhou, D.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.146973Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:eddacbf6ac87b7d8811b980fe4c8c96470c7d030105e3414d81927bbc90e8cde","observation_id":"a81d78a3-00e7-4120-bc75-c523599c43e7","resolution":{"observed_at":"2026-08-05T20:30:30.146973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04658","last_updated":"2024-05-11T07:08:16Z","snapshot_observed_at":"2026-08-05T22:16:53.109945Z","submitted_at":"2023-09-09T01:56:40Z","title":"Exploring Large Language Models for Communication Games: An Empirical Study on Werewolf","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04658","snapshot_observed_at":"2026-08-05T20:30:30.149845Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.149845Z"},"links":{"cited_paper":"/paper/2309.04658","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:0d1ff1e6015dd6da034a8215ff65892a858e216f7ed758d96783da80196e297d","observation_id":"7ec19a5a-b486-460d-bf68-d71f42a55245","resolution":{"observed_at":"2026-08-05T20:30:30.149845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.152711Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.152711Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:6ffee3a5933dd28cdcec51362dd7aa282c795444df0b52a7e333be03c933a3f1","observation_id":"17bad6cb-08d8-4fa7-ae26-f9c03a337197","resolution":{"observed_at":"2026-08-05T20:30:30.152711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.156489Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.156489Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:1be02486c04618fc29285f66a568413e2a442075845dbb3187125c60b824fc3f","observation_id":"decb996e-fb87-4d6e-bca9-4778c7a89e27","resolution":{"observed_at":"2026-08-05T20:30:30.156489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.159198Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.159198Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:7312fd400668b059559643f80683cad0303bd45c827056c7ea25519b0d7862fc","observation_id":"35b59c4f-6776-4b7f-b325-341e092b3b3b","resolution":{"observed_at":"2026-08-05T20:30:30.159198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-05T20:30:30.162000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.162000Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:6f7faa1bee3617b1b0a531d7b7e52bb3abff7f638bc3d046753719542c5e6597","observation_id":"7053f5d5-dea0-40bc-9503-8717edc46fbd","resolution":{"observed_at":"2026-08-05T20:30:30.162000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.354063Z","title":"Y.; Ju, J.; Nguyen, A","venue":null,"work_id":"8f867753-024b-47fc-8843-55ed7bf29634","year":2025},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.164783Z"},"links":{"citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:fc881876f8e468a9f69ecac72ff0511d93e62dc15f1fa0d4496ab90403c2a7cd","observation_id":"6a41886f-e875-406b-9aac-2dd5df8f76f6","resolution":{"observed_at":"2026-08-05T20:30:30.357438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T20:30:30.167398Z","title":"F.; Zhu, H.; Zhou, X.; Lo, R.; Sridhar, A.; Cheng, X.; Ou, T.; Bisk, Y.; Fried, D.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.167398Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:916829e2c59af7e03f5675eccf0ef6efb92359c114a1be6a50578d75b338a6f4","observation_id":"86275c19-63dd-4d84-b96b-ff9cbb9321a8","resolution":{"observed_at":"2026-08-05T20:30:30.167398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2508.10428."}