{"as_of":"2026-08-07T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:962fbdd073461c869cc87d20a2f38d26398e1d3b25710db9fb7ec6fa8c10643c","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:13.953628Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23626/citation-record","integrity":"/paper/2506.23626/integrity","json":"/paper/2506.23626/citation-record.json","paper":"/paper/2506.23626"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:16.492940Z","title":null,"venue":null,"work_id":"73e89001-e4eb-4e09-a730-16a76b667b33","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.179049Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:046c0d358711073927ab825f8e645d6280804d47885f533283b6278fab723131","observation_id":"f13b1593-9979-4bf9-af18-bb1a1b7a84c6","resolution":{"observed_at":"2026-08-06T21:41:16.571140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:16.292956Z","title":"Instructions","venue":null,"work_id":"dab03f64-dace-4e5f-89e2-54bd855b1366","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.299088Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:13c9a018f3d0016d6f52f236c6f2c2fab903c4c6252993f340d74a4d1b56a3e7","observation_id":"b3449306-4e61-4056-9538-1e58989b0715","resolution":{"observed_at":"2026-08-06T21:41:16.378885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.657207Z","title":"• Adjust values to encourage the agent to complete the goal properly rather than remaining close to it","venue":null,"work_id":"48935ecb-ecb4-4a60-bde9-c4423ad2e4c1","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.519280Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:2ba49e1e14e24b058fbfd91bd8b30b87390178300d39c409304ac09a2f7fef54","observation_id":"3a6e5395-af65-4535-bcb8-925621b60483","resolution":{"observed_at":"2026-08-06T21:41:15.765168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.432042Z","title":null,"venue":null,"work_id":"2bc51fa5-0210-4bf0-8094-28517dd25e30","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.606616Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:9f2688a6246790db20415e8bef6a816d125f12faf7ca572589d3033e3c6eaf91","observation_id":"02429b1e-248e-4587-8aeb-b749060398cd","resolution":{"observed_at":"2026-08-06T21:41:15.533487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:16.095473Z","title":null,"venue":null,"work_id":"88d21bc6-4456-4094-9116-63e4d9aa4c39","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.394406Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:286edd57137374c9c24b1af1bd3e1326e7949dad76b65bec595405393e13abbf","observation_id":"8cd012bf-5014-47db-a29b-7e198e3d1ee5","resolution":{"observed_at":"2026-08-06T21:41:16.179890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.876038Z","title":"• These parameters control the agent’s learning and behavior","venue":null,"work_id":"dd79a44b-fc4f-4d4d-8ec0-a8aae47dbb5b","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.462055Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:cd253ee68c0a05e01fe603d2eba65940adb2ec14dfb713444b76d6e0eb73f83f","observation_id":"ea1367b6-e3a6-4383-8564-c12a9ee351f8","resolution":{"observed_at":"2026-08-06T21:41:15.991458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.251308Z","title":"For instance, if theProblem description is talking about making the agents collide less, but does not refer hitting the fence,do not change the fence collision penalty","venue":null,"work_id":"48e32a3c-2cb3-4b77-9745-fbbccb5a23c2","year":2025},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.718492Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:09090c7c953fc9cbbe3706ee312d6abc7d150be55453fc23c2635268ec14ebfa","observation_id":"3f643437-5a2b-43bd-8a36-28e141c0720b","resolution":{"observed_at":"2026-08-06T21:41:15.336253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.099200Z","title":"• The format of the outputmust be identicalto the .txt file","venue":null,"work_id":"505f21db-706c-4d49-a027-1add2a6adba2","year":2025},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.993083Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:470b8e946082aa6566c754d81f8cccbcfba9f3392d31d547ed06adf3fed36815","observation_id":"d9417170-972f-4942-b930-3069e9e49353","resolution":{"observed_at":"2026-08-06T21:41:15.161476Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.880615Z","title":"in the least amount of time steps","venue":null,"work_id":"90d7a716-6151-4d53-a944-15e926c7bdda","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:12.040776Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:b98bf10d1c91a6c32128b81d7175249e58544cd0d2fca60ac7d816b2034f2232","observation_id":"950e8afd-d779-430d-98f7-bdd64b67600c","resolution":{"observed_at":"2026-08-06T21:41:14.974683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.673991Z","title":null,"venue":null,"work_id":"0db835a3-70b9-4d5b-9fdb-df67aa48bc32","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:13.661770Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:0dc086e513fb92c67e8c64ee7cbefd28e22e41e754173d0ab33cfe8da6138057","observation_id":"9e02ff12-8e3c-4c01-a2f2-edbacc489886","resolution":{"observed_at":"2026-08-06T21:41:14.763880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.520926Z","title":"Try to be creative with the solution, ie","venue":null,"work_id":"e4144b70-811a-4967-97a1-860a44891cf3","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:13.861797Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:c3f6202de6d35d44356e3c6586cb5f273c8e8086d79c9ae28e00553487dfbee0","observation_id":"59b48f51-89e1-4354-b052-6931d15109b6","resolution":{"observed_at":"2026-08-06T21:41:14.577985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.352033Z","title":"Your output should be the updated reward function file only","venue":null,"work_id":"df4f07a5-c9b0-4583-8277-9e8d9c67b685","year":2018},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:13.953628Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:92895a949a6e4a273e7b1b554610a274d295dd1acba72e50c7b5778c16afaa31","observation_id":"2f60979a-0dca-4fcd-9b60-c098dc3bde44","resolution":{"observed_at":"2026-08-06T21:41:14.422955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.31757","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.154947Z","title":"Yan Zheng, Xiaofei Xie, Ting Su, Lei Ma, Jianye Hao, Zhaopeng Meng, Yang Liu, Ruimin Shen, Yingfeng Chen, and Changjie Fan","venue":null,"work_id":"d0456f43-a29b-430d-bc30-f401c498911a","year":2022},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.113675Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:21d638ee5d45cfacf39d584add9eaeb747dafa602db594282f19961e26eca85d","observation_id":"c3808800-ed00-446a-8938-fb0675132a38","resolution":{"observed_at":"2026-08-06T21:41:14.245278Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15568","last_updated":"2025-02-14T14:24:59Z","snapshot_observed_at":"2026-07-06T18:19:21.735356Z","submitted_at":"2024-05-24T13:57:32Z","title":"OMNI-EPIC: Open-endedness via Models of human Notions of Interestingness with Environments Programmed in Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15568","snapshot_observed_at":"2026-08-06T21:41:10.068318Z","title":"it’s unwieldy and it takes a lot of time","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.068318Z"},"links":{"cited_paper":"/paper/2405.15568","citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:df36e8b29a0bed663d1ab31d0c9e033aa812caf47bf78974a948ff756515c69f","observation_id":"1bd7b80f-7613-4173-ba96-9553b70eddc3","resolution":{"observed_at":"2026-08-06T21:41:10.068318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2506.23626."}