{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c1b2f4be3444700d08943936acfc896a69297088124398a4e510c0c299031fa","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:07:25.450652Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T06:36:56.956656Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"cited_work":{"arxiv_id":"2502.10200","doi":"10.48550/arxiv.2502.10200","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shibata Dynamic Reinforcement Learning for Actors arXiv preprint, 2025, doi: 10.48550/arXiv.2502.10200","venue":"ArXiv.org","work_id":"ce5925fe-c946-479e-be66-8f9f1ba820cb","year":2025},"citing_paper":{"arxiv_id":"2507.04346","last_updated":"2026-07-20T17:22:26Z","snapshot_observed_at":"2026-08-07T22:57:02.882450Z","submitted_at":"2025-07-06T11:19:34Z","title":"Temporally smoothed incremental model-based heuristic dynamic programming for command-filtered cascaded online learning flight control","version":7},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T06:36:56.956656Z"},"links":{"cited_paper":"/paper/2502.10200","citing_paper":"/paper/2507.04346"},"observation_digest":"sha256:d21b7313a5a8bde62c814dd34f71d443fd527b8bea0da5cd6e3464c8c3b285e9","observation_id":"7be5454f-03bf-4c06-9b4d-673946b1e8ed","resolution":{"observed_at":"2026-05-19T06:37:07.045942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10200/citation-record","integrity":"/paper/2502.10200/integrity","json":"/paper/2502.10200/citation-record.json","paper":"/paper/2502.10200"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.07526","last_updated":"2023-07-11T11:44:09Z","snapshot_observed_at":"2026-08-06T07:37:54.961051Z","submitted_at":"2023-07-11T11:44:09Z","title":"Can I say, now machines can think?","version":1},"cited_work":{"arxiv_id":"2307.07526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.07526","snapshot_observed_at":"2026-08-07T19:07:26.392138Z","title":"Can I say, now machines can think?","venue":"cs.AI","work_id":"74c3925c-8cb8-4eca-aab7-0777dd68d183","year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.154319Z"},"links":{"cited_paper":"/paper/2307.07526","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:de3b57a270f34423aea47bd8e1e8532e088d791632f4bd68018317d4b5c4cc68","observation_id":"1ec14da0-79da-4785-90b6-29f5601b08a4","resolution":{"observed_at":"2026-08-07T19:07:26.397047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.160579Z","title":"Aihara, T","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.160579Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:08ed757bff54f0172454ce3f54e73d378ccf15b0c6bea3e4db79e2fd375a9533","observation_id":"28349bd4-8bc5-4941-8b46-6ebec2dfccc2","resolution":{"observed_at":"2026-08-07T19:07:25.160579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06931","last_updated":"2020-03-18T01:00:37Z","snapshot_observed_at":"2026-07-06T08:51:30.602165Z","submitted_at":"2020-01-20T01:09:53Z","title":"Any Target Function Exists in a Neighborhood of Any Sufficiently Wide Random Network: A Geometrical Perspective","version":2},"cited_work":{"arxiv_id":"2001.06931","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.06931","snapshot_observed_at":"2026-08-07T19:07:26.310190Z","title":"Any Target Function Exists in a Neighborhood of Any Sufficiently Wide Random Network: A Geometrical Perspective","venue":"stat.ML","work_id":"86e36a33-2f96-48e0-8a8b-b1e653307f40","year":2020},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.166518Z"},"links":{"cited_paper":"/paper/2001.06931","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:75a0fca847437540ea05681abae320e78a987442792d8f82dd7f3ca94e1e4588","observation_id":"1c0abd69-1693-432d-b8c0-603607caf7f3","resolution":{"observed_at":"2026-08-07T19:07:26.315003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:27.038886Z","title":"Andrychowicz, F","venue":null,"work_id":"66e162be-1a1c-41ce-93a6-6a445ab7e604","year":2017},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.171623Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:60045b27097377ebad133affa99f56410c83d0ccfbfdf33a459aeb6e5e73b530","observation_id":"1c7bb315-e3da-4197-bf53-2ca238a407ad","resolution":{"observed_at":"2026-08-07T19:07:27.043286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.86089","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.290989Z","title":"Azizi and G","venue":null,"work_id":"383d7419-c1d7-45ee-867c-ff625d567a3a","year":2020},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.176374Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:6a60d027183bce91265c8c0f496ae12c0d5e3c40d787b7f85334d28267bfd640","observation_id":"259cb42c-a97a-4417-a27d-fcfc03b285b6","resolution":{"observed_at":"2026-08-07T19:07:26.296953Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:27.024641Z","title":"Berlyne and W","venue":null,"work_id":"1f7fa638-c36a-4aa7-a3c4-9e307f08424b","year":2025},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.180983Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:d1f3e5d2c0dc262dcb8abdfde6ae2b3eabe114a2d27ad93d5aa07f6969332804","observation_id":"377bd31a-6354-49d7-811a-6b6bbe73a8d4","resolution":{"observed_at":"2026-08-07T19:07:27.028649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05599","last_updated":"2021-07-12T17:29:28Z","snapshot_observed_at":"2026-08-04T08:59:22.122015Z","submitted_at":"2021-07-12T17:29:28Z","title":"Active Divergence with Generative Deep Learning -- A Survey and Taxonomy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05599","snapshot_observed_at":"2026-08-07T19:07:25.186334Z","title":"Broad, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.186334Z"},"links":{"cited_paper":"/paper/2107.05599","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:d48bba14b1a3da5768ff21108dbf8fdca488c253b0398e3d37931357f2d0de18","observation_id":"c853da98-0f1a-4364-b8fe-df3bc71d3fb0","resolution":{"observed_at":"2026-08-07T19:07:25.186334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:27.012255Z","title":"Statement on AI risk, 2025 a","venue":null,"work_id":"f718f1a9-a786-4907-8c3f-2fb719b979fb","year":2025},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.190413Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:dfafebca906381d6069caccfc35ed67a57c47400587195f8475650d5a00d55a1","observation_id":"c484f11f-3c07-4f53-bd01-8ebdf8385ffb","resolution":{"observed_at":"2026-08-07T19:07:27.016320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.999726Z","title":"An overview of catastrophic AI risks, 2025 b","venue":null,"work_id":"729ae120-a3cb-49df-b61b-98aee8108ba4","year":2025},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.194364Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:254b64193023953dd42ff797850f851ddbb81b4b486e9d157e7daa7c0873766a","observation_id":"ead8142e-04d5-40a2-b5b3-3867c44848f2","resolution":{"observed_at":"2026-08-07T19:07:27.003975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14556","last_updated":"2024-03-08T05:20:08Z","snapshot_observed_at":"2026-07-06T16:23:34.422580Z","submitted_at":"2023-09-25T22:02:46Z","title":"Art or Artifice? Large Language Models and the False Promise of Creativity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14556","snapshot_observed_at":"2026-08-07T19:07:25.198212Z","title":"Chakrabarty, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.198212Z"},"links":{"cited_paper":"/paper/2309.14556","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:f846faacf41934cf3813b0461fb694eb8a0b4659ed3c393a3126f04b3842351e","observation_id":"c52952a1-8c40-4e3e-a4ef-03244c2af132","resolution":{"observed_at":"2026-08-07T19:07:25.198212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.987683Z","title":"The alternative uses test, 2018","venue":null,"work_id":"1948ceb9-1bc4-4fa3-9f09-2be45d2b06e4","year":2018},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.202740Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:1e064a71bde1a347bc3ed416b5cf58622b9ec21324a48b918e71c94c92ef6fb7","observation_id":"26a6625f-4522-48ef-b3ec-5a134256a63d","resolution":{"observed_at":"2026-08-07T19:07:26.991298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.974945Z","title":null,"venue":null,"work_id":"41a88571-b01b-43b9-8c79-384e9af1ca2b","year":1971},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.206644Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:a006ec4d34f16ae96866618dbed8303c5aca776b968230bde8ac5562eaa0ad1a","observation_id":"4ddcb73b-9a6c-4eb9-8b9a-b7c24c5ae6b5","resolution":{"observed_at":"2026-08-07T19:07:26.978839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neunet.2022.05.012","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.545632Z","title":null,"venue":null,"work_id":"6484c6cd-f728-44c2-9907-fd58537346ad","year":2022},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.210282Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:0f390ee7b1e485e7714ee82a8ef22b5c7b513dfcb4a514a3b3788adf25846afa","observation_id":"9aa920ac-df9a-4ec0-a580-31af5c6ce784","resolution":{"observed_at":"2026-08-07T19:07:25.549972Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00099","last_updated":"2024-10-07T16:45:42Z","snapshot_observed_at":"2026-08-06T13:43:51.296762Z","submitted_at":"2024-04-30T18:00:02Z","title":"Creative Beam Search: LLM-as-a-Judge For Improving Response Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00099","snapshot_observed_at":"2026-08-07T19:07:25.214486Z","title":"Franceschelli and M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.214486Z"},"links":{"cited_paper":"/paper/2405.00099","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:4c31972274d5adc8d86226238eb109cc274f8f20ebc95f8218080a6b1d4f81b7","observation_id":"e6541dd2-6962-439b-b162-da5c76e9c24d","resolution":{"observed_at":"2026-08-07T19:07:25.214486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.960716Z","title":null,"venue":null,"work_id":"5033815a-2729-4eb1-a35d-6f2b67074931","year":1991},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.219203Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:f516ac27e7d4a9a7a3f238bce1e0e6c3bc4d50d3e9c5eb1d876747d963c34a54","observation_id":"0c6b79a1-bce9-445a-b509-10bc37ffacc5","resolution":{"observed_at":"2026-08-07T19:07:26.965071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.946979Z","title":"Fujimoto, H","venue":null,"work_id":"933e326e-5327-444d-8b64-67aa220f5cb2","year":2018},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.223783Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:b477011c6799c16f6d48e7677ea2256cb429c800e55e3d9cc75a69a757e8ae1a","observation_id":"04004886-f679-42fd-b756-62e850f00150","resolution":{"observed_at":"2026-08-07T19:07:26.951562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.932757Z","title":"Research priorities for robust and beneficial artificial intelligence: An open letter, 2015","venue":null,"work_id":"596aaa8b-9930-45e7-a181-230cea1e7f51","year":2015},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.227950Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:fdb2c50a669567ca1fe3ca562080253769965e566e4019c47abf7d96bb29ba4f","observation_id":"95473fc4-335b-4e89-9cc1-bfb984da374f","resolution":{"observed_at":"2026-08-07T19:07:26.937581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19555","last_updated":"2024-01-02T22:30:00Z","snapshot_observed_at":"2026-07-06T15:35:45.200564Z","submitted_at":"2023-05-31T04:50:29Z","title":"Large Language Models Are Not Strong Abstract Reasoners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19555","snapshot_observed_at":"2026-08-07T19:07:25.232473Z","title":"Gendron, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.232473Z"},"links":{"cited_paper":"/paper/2305.19555","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:d246fc9bdbe3ab242b56613ab3dc8f71018a34078c5714c838a44cc8a0be9a95","observation_id":"d300d54c-f16b-44d4-9b4f-e2e93dc2e476","resolution":{"observed_at":"2026-08-07T19:07:25.232473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.917200Z","title":"Goto and K","venue":null,"work_id":"828b57d0-c7b4-418b-acdc-446fa7f1f8af","year":2010},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.236866Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:9cc1350d5a8b54ec0a55acc31e3cfaf3904a0924f6b90adec7eb330b27db666b","observation_id":"1a2574c0-1756-4d9d-ae57-7a3cc3da2e9d","resolution":{"observed_at":"2026-08-07T19:07:26.922747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.901743Z","title":null,"venue":null,"work_id":"d68748ff-fbe9-44b0-82f5-703d5fe0ab27","year":1967},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.241574Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:7fb108d33b326466cb0c494d84e20156a6e73088c7aab8f35e8010b67fc6d809","observation_id":"ccef354b-ffe4-41ca-990e-653835134b3e","resolution":{"observed_at":"2026-08-07T19:07:26.906795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.245523Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.245523Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:628813b77a96e7986a23b7eccdc374ff73d893a793b5818fbe5ed9c97aaccb37","observation_id":"1bbccc8e-a87c-4b59-bdf6-0ef6844955aa","resolution":{"observed_at":"2026-08-07T19:07:25.245523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.888193Z","title":"Haarnoja, A","venue":null,"work_id":"d3d24ad2-e823-4c38-bbc0-d01e0e05a31c","year":2018},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.249348Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:ed9ba330fe255f77ecf54c4c5a8ed19b0d6d751b141f23f48a60efded28145ce","observation_id":"ac096356-3161-4daf-8dfa-c9693e4791c9","resolution":{"observed_at":"2026-08-07T19:07:26.892095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.874232Z","title":"Huang, S","venue":null,"work_id":"91ededf8-fa52-431a-91de-7432d7e79117","year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.253108Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:ac60c11807634e94c9c7fa211d862278b0d053b513f3e572d627206bf82a453f","observation_id":"7dbe6518-1db2-4038-85dc-f67eeb01d6bc","resolution":{"observed_at":"2026-08-07T19:07:26.878920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17218","last_updated":"2025-06-29T16:35:17Z","snapshot_observed_at":"2026-08-03T21:05:19.268419Z","submitted_at":"2024-10-22T17:43:39Z","title":"Creativity in AI: Progresses and Challenges","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17218","snapshot_observed_at":"2026-08-07T19:07:25.256935Z","title":"Ismayilzada, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.256935Z"},"links":{"cited_paper":"/paper/2410.17218","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:55863ea69a8683b43ce01bf37434efe3f6f02e815c9664f283042e7654c91223","observation_id":"0912888d-f5fa-42a4-a746-fd74fd9a6fba","resolution":{"observed_at":"2026-08-07T19:07:25.256935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05057","last_updated":"2023-11-09T19:45:13Z","snapshot_observed_at":"2026-07-06T16:29:19.703823Z","submitted_at":"2023-10-08T07:46:01Z","title":"BRAINTEASER: Lateral Thinking Puzzles for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05057","snapshot_observed_at":"2026-08-07T19:07:25.260570Z","title":"Jiang, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.260570Z"},"links":{"cited_paper":"/paper/2310.05057","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:bcb65cfa2fd94d63ba27d5242f9e5930404e7b32c58e119f6a0b66c40a5fafd8","observation_id":"438312f1-2ed0-43a6-87ba-195065a4c6a8","resolution":{"observed_at":"2026-08-07T19:07:25.260570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.859935Z","title":"Creativity","venue":null,"work_id":"2cb3bfb2-3bcf-4fd9-82a7-7a1705fd70fd","year":1950},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.264294Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:db0b0e44ca03ef7430b7f1af2a68168496f09f40100ccd3a7438462bf3120991","observation_id":"47709292-6a33-488f-a45b-f0f35bd9f59c","resolution":{"observed_at":"2026-08-07T19:07:26.864614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.846616Z","title":"Khachaturyan, S","venue":null,"work_id":"e9ac1be6-e92f-483a-ac96-91dc8c8d3128","year":1981},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.268590Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:e4f1b1b8eb746238eb0fb18e562d32f2827669433714a6c0db8837371a07953a","observation_id":"47f466da-ef4c-4232-baa8-1c231d480aff","resolution":{"observed_at":"2026-08-07T19:07:26.850980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.833705Z","title":"Koivisto and S","venue":null,"work_id":"aa46204f-57e9-4c05-a5fe-906a13b048eb","year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.272818Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:6d50b9074b0aec04b03482cde2ac96ee7edf6b9910d3ec5d5caeb36ca09d2a49","observation_id":"b5361bcc-dd35-4e15-ab15-ab4093a9582c","resolution":{"observed_at":"2026-08-07T19:07:26.837745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.820240Z","title":null,"venue":null,"work_id":"e7bc11a0-354e-4c2a-a497-b0c3397fbe48","year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.277266Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:ecee69448d2fc56a304fda2a49df84d54a3b40aa6d7333b70e13c1158168c83d","observation_id":"4f34e5fa-38a8-4f73-aece-c427366422b1","resolution":{"observed_at":"2026-08-07T19:07:26.824897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.804944Z","title":"Kurzweil","venue":null,"work_id":"9a8c936c-8b21-4124-aae3-2821da4a1af6","year":1998},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.281361Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:d36dd9cfc4ee4f00f04c19af42d1a3626fd1aa38b22389e7c6044909f170ebb7","observation_id":"e94891ad-91c4-41bc-9e3d-34f99356c730","resolution":{"observed_at":"2026-08-07T19:07:26.809675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04265","last_updated":"2025-01-12T05:32:57Z","snapshot_observed_at":"2026-07-06T19:28:26.436468Z","submitted_at":"2024-10-05T18:55:01Z","title":"AI as Humanity's Salieri: Quantifying Linguistic Creativity of Language Models via Systematic Attribution of Machine Text against Web Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04265","snapshot_observed_at":"2026-08-07T19:07:25.285924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.285924Z"},"links":{"cited_paper":"/paper/2410.04265","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:031e4ef537cee441c25b60c88965d5bbbdc40733d3b9e487f0d790bde27e765d","observation_id":"baa3fa8b-e7ae-4a56-b9f9-4bfb0d0b1347","resolution":{"observed_at":"2026-08-07T19:07:25.285924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.790854Z","title":"Matsuki and K","venue":null,"work_id":"84ddf829-da2c-4d21-9f8c-4752440bbc2d","year":2020},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.291802Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:de9742eb0b7a38d86f92e821886cd3346a3637439baae1b90fc4cf16e8e57aa9","observation_id":"64867c5a-43a9-479a-8ab3-647acc2032cd","resolution":{"observed_at":"2026-08-07T19:07:26.795469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.09086","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.057832Z","title":"Matsuki, Y","venue":null,"work_id":"cf4ebbea-6db1-4a5c-afb8-cb4ccb8e92a0","year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.296529Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:1ebd8dd862e77065a7f9b7695b317e56cb71477993d35822536f89655d7a9f86","observation_id":"dcc27c0c-fdb8-4a56-bff2-43d80cff4c55","resolution":{"observed_at":"2026-08-07T19:07:26.063998Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.777482Z","title":"McCulloch and W","venue":null,"work_id":"2ef8d098-a47f-450a-93fb-515bc8853c5d","year":1943},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.301436Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:74b48728abf6e8154c8d7d28f4306fdde80eddb4997e3e88e33f80c1476c7c52","observation_id":"d62fe747-6738-4245-bdb7-464459f28e64","resolution":{"observed_at":"2026-08-07T19:07:26.781625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09247","last_updated":"2023-12-11T23:57:17Z","snapshot_observed_at":"2026-07-06T16:48:09.248740Z","submitted_at":"2023-11-14T04:33:49Z","title":"Comparing Humans, GPT-4, and GPT-4V On Abstraction and Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09247","snapshot_observed_at":"2026-08-07T19:07:25.306111Z","title":"Mitchell, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.306111Z"},"links":{"cited_paper":"/paper/2311.09247","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:9fa1d1be883c518a0114edf9bd50bd95975481df1d6785b41bd6caa57ee83d03","observation_id":"a623cb31-b245-4796-abf5-cd563d500e77","resolution":{"observed_at":"2026-08-07T19:07:25.306111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.311005Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.311005Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:ae58c3ba19cfaac242c6bdac5a80882d56ee4796803fee9e0c2d83a7ff65f485","observation_id":"8b7c4dc0-c179-4bb3-b4ed-4e10f2f5aba2","resolution":{"observed_at":"2026-08-07T19:07:25.311005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-07-06T04:45:11.148515Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T19:07:25.315321Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.315321Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:11712a234748c3a8cfa182b4c9773a6545aa952da9fe3c652d68bce5a0c48134","observation_id":"c4c17a51-bb00-45b6-ad81-8d7f197e4ec4","resolution":{"observed_at":"2026-08-07T19:07:25.315321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00899","last_updated":"2024-06-05T19:15:43Z","snapshot_observed_at":"2026-08-05T23:45:07.847598Z","submitted_at":"2024-05-01T23:06:46Z","title":"Characterising the Creative Process in Humans and Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00899","snapshot_observed_at":"2026-08-07T19:07:25.319587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.319587Z"},"links":{"cited_paper":"/paper/2405.00899","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:32d35ab3a8a233c2fd60a4674df4f117faa486893028f771fdb62a71636ba2d5","observation_id":"0d1bdc33-c100-4c6d-9621-38acb2cb02f0","resolution":{"observed_at":"2026-08-07T19:07:25.319587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.763761Z","title":"Newell, J","venue":null,"work_id":"939ffb04-7852-4447-bced-e56344c45337","year":1959},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.323985Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:1e64516d9fc1f1f2bacedb0da5c6f0171271fe0914f9365a50b38cc7135e6e21","observation_id":"2e3cc862-1886-4615-8d71-feb6f9f05d46","resolution":{"observed_at":"2026-08-07T19:07:26.768498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.751210Z","title":"OpenAI Five , 2019","venue":null,"work_id":"06ce649b-57a4-4480-a487-4e1cd3479098","year":2019},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.328142Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:3c8f187901cebc97a8abc228e0054848b5276b76374bf640d2c95234063cffcc","observation_id":"ba9a4523-4bae-4a4c-995c-0f04e6588a3c","resolution":{"observed_at":"2026-08-07T19:07:26.754853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.738756Z","title":"GPT-4 , 2023","venue":null,"work_id":"0449c671-c421-4852-ab19-8f622503bdcb","year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.331524Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:a64e7f2a5ed299c623dfd62b78d808fa4e1db364865671073d12b9dc2e8fbcb0","observation_id":"7d817cc5-7d64-4846-acb4-c42cad585af0","resolution":{"observed_at":"2026-08-07T19:07:26.742591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T19:07:25.335218Z","title":"Achiam, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.335218Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:b5ab29a061d5809c95fb2ad919e42d008acef1fb0937a2147a0e089ffd9f361e","observation_id":"45d1ec93-e47c-4a30-bd16-4aa64f3ad1b2","resolution":{"observed_at":"2026-08-07T19:07:25.335218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00492","last_updated":"2024-05-01T12:59:37Z","snapshot_observed_at":"2026-07-06T18:08:13.456457Z","submitted_at":"2024-05-01T12:59:37Z","title":"Is Temperature the Creativity Parameter of Large Language Models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00492","snapshot_observed_at":"2026-08-07T19:07:25.339154Z","title":"Peeperkorn, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.339154Z"},"links":{"cited_paper":"/paper/2405.00492","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:72dc5e114f4dd0323e978cd99d9a3b609a9f356917f198bd6cc3bc49694485a3","observation_id":"b6f3f176-c7af-4d0e-9bfd-c363115b7966","resolution":{"observed_at":"2026-08-07T19:07:25.339154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.727178Z","title":"Pichai, D","venue":null,"work_id":"696f3c40-cc02-4920-876d-753ffefb5245","year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.343037Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:c3d49749e5758383ae69cf45367aee3f3f3d3d24d744b51c839a84ed6628b366","observation_id":"fd14ff61-dea1-47f7-8e25-9b68f6f0f1df","resolution":{"observed_at":"2026-08-07T19:07:26.731960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.715404Z","title":null,"venue":null,"work_id":"ef818c7a-6bc4-4134-a60c-e86e80519721","year":2001},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.346949Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:f50f8616c20bd55e41f4461e9fd50a7ac0e3ce2d8affdfc14e93531ad22f07a8","observation_id":"bbf03383-89cf-482e-a3d6-80f36187af94","resolution":{"observed_at":"2026-08-07T19:07:26.719324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.624141Z","title":null,"venue":null,"work_id":"4d1335b4-5322-49e8-85a7-68f107bd63b0","year":1986},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.352097Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:c4e26d3a9dda3b0f7888d851b059790fa083119c2ca7baed35f686e82dae4bf8","observation_id":"f5e8aa09-3ccf-4ba8-b3ae-a5403abb21f3","resolution":{"observed_at":"2026-08-07T19:07:26.677348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.567050Z","title":"Sawatsubashi, M","venue":null,"work_id":"8844607d-d7a2-4cc0-a739-c6158125ff76","year":2012},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.356240Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:5640054dd632e0aaa31575287668d64064c79f0340115cf0d1cf1ac530b50bdd","observation_id":"b260205c-741e-4f7d-b7e2-88b0f7dcb6c9","resolution":{"observed_at":"2026-08-07T19:07:26.587740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-07T19:07:25.360788Z","title":"Schaul, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.360788Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:6cbfe11eb2d6b528bc6e9c85d454140154e60c3e382b68bb1f80f7aa56dca78d","observation_id":"0b462b86-7a7d-4100-9c3a-a52baeb23fc6","resolution":{"observed_at":"2026-08-07T19:07:25.360788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.365514Z","title":"Schrittwieser, I","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.365514Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:0cef2490b6dd04046b6a68898b59d7e84be0e3945f9ef186877dff80c2f96ee3","observation_id":"5e8545b7-1c80-47e6-b156-7e3e5479e483","resolution":{"observed_at":"2026-08-07T19:07:25.365514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.547957Z","title":"Schulman, F","venue":null,"work_id":"2acee8de-64e3-4036-b1b2-3a5537cc1c59","year":2017},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.369666Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:1e84b3d057ae646f902841e9b9a0537f6b6a4c9be4c9de3093d248e56354da11","observation_id":"7f6d76df-97fd-4a7e-9849-4024a80b709c","resolution":{"observed_at":"2026-08-07T19:07:26.552584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.531667Z","title":null,"venue":null,"work_id":"cd1023a1-2a4e-4b56-affb-e2c004866c15","year":2006},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.374248Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:c277b0650880c77f1ae399d430194075a669e315bfd586b80931b63e27501035","observation_id":"4968dc46-e457-406f-a229-667915bec91f","resolution":{"observed_at":"2026-08-07T19:07:26.536810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5772/13443","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.514368Z","title":null,"venue":null,"work_id":"988681ce-080f-4cef-8308-cebcc2ba9cba","year":2011},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.377514Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:41a807a766aeef49efb5152f67e2bca721b60e72715ff7839eca46596c7042b8","observation_id":"52e13e57-b625-484f-8339-6315628f90fc","resolution":{"observed_at":"2026-08-07T19:07:25.518668Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03543","last_updated":"2017-05-16T07:27:12Z","snapshot_observed_at":"2026-07-06T05:33:08.610018Z","submitted_at":"2017-03-10T04:41:29Z","title":"Communications that Emerge through Reinforcement Learning Using a (Recurrent) Neural Network","version":2},"cited_work":{"arxiv_id":"1703.03543","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.03543","snapshot_observed_at":"2026-08-07T19:07:25.849594Z","title":"Communications that Emerge through Reinforcement Learning Using a (Recurrent) Neural Network","venue":"cs.AI","work_id":"d6ecad21-8376-4c6e-843b-7fa67ae8e84e","year":2017},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.380938Z"},"links":{"cited_paper":"/paper/1703.03543","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:69ea5094b94e3c772884b5b3dffd14fb7a23ab6510a15f1880d96520b74d1d51","observation_id":"54b98b14-b07b-4a97-9015-c9bd09a26fa0","resolution":{"observed_at":"2026-08-07T19:07:25.853708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.02239","last_updated":"2017-05-16T07:22:07Z","snapshot_observed_at":"2026-07-06T05:32:39.132929Z","submitted_at":"2017-03-07T06:51:19Z","title":"Functions that Emerge through End-to-End Reinforcement Learning - The Direction for Artificial General Intelligence -","version":2},"cited_work":{"arxiv_id":"1703.02239","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.02239","snapshot_observed_at":"2026-08-07T19:07:25.830152Z","title":"Functions that Emerge through End-to-End Reinforcement Learning - The Direction for Artificial General Intelligence -","venue":"cs.AI","work_id":"fd7af222-5e43-4c13-b486-525ccac4b317","year":2017},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.385087Z"},"links":{"cited_paper":"/paper/1703.02239","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:5090b778a672930fa1f18bc2efb2e8cb375377d9f0ce5bf07c49c785e99a4b56","observation_id":"33424638-049a-4dd4-87a1-231258f290b2","resolution":{"observed_at":"2026-08-07T19:07:25.836100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.515728Z","title":"Shibata and K","venue":null,"work_id":"7949c98e-e753-47da-a3c9-e2ba1663152a","year":1999},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.388480Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:cdafb799f4a695d475cd9f698f439e7925bee1b498e1ea31ccb353e03c78466b","observation_id":"6f2d4dfe-5aba-4b7e-a397-15e3d7adb2ef","resolution":{"observed_at":"2026-08-07T19:07:26.520135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.500612Z","title":"Shibata and Y","venue":null,"work_id":"29cf85e5-83ad-4f17-af50-a3e6e469139a","year":1997},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.391950Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:2af970acec17750a06731cff692f2fedd4404e0c6a5d057ab5ea5185efd3b9bc","observation_id":"44d3b80a-8a8e-4fdd-b614-855afaf68761","resolution":{"observed_at":"2026-08-07T19:07:26.505885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.486636Z","title":"Shibata and Y","venue":null,"work_id":"83b3bf0d-cef9-4bfd-9278-cac3eef2f41b","year":2015},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.395959Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:a554ed93bb679fc1f9c009c62e2c2515911920648cef07e5925591a06e8baab6","observation_id":"5ec49e9a-0d84-426a-b665-2f8f5000210e","resolution":{"observed_at":"2026-08-07T19:07:26.491095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.471730Z","title":"Shibata, T","venue":null,"work_id":"f9fa5dd5-f3ff-455e-993c-daad07bb8194","year":2021},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.399998Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:075d00e1ccae7bdfda8dc45b81d782847a5bc7b00ea42f74ac065f7d311781d8","observation_id":"5bb07383-ff04-4a80-947c-f193d8a4c461","resolution":{"observed_at":"2026-08-07T19:07:26.476426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.457883Z","title":null,"venue":null,"work_id":"dca71273-28b8-4f11-8b3c-53500327bc25","year":1987},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.405265Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:062f30ddcae76a4329754a73e1252b6eaa71e149a4b320b2f99e76e83e1de3e3","observation_id":"ba4ae6c7-14e9-4da0-b737-dc48e0b74834","resolution":{"observed_at":"2026-08-07T19:07:26.462242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.409586Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.409586Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:e5466ea39f00c41faa9c6be883b8e0ab9734c9a340e4c05a5abb25aa00b14c9b","observation_id":"87713aa5-2dcf-4f16-8bca-6267426a7050","resolution":{"observed_at":"2026-08-07T19:07:25.409586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08412","last_updated":"2023-12-02T18:10:15Z","snapshot_observed_at":"2026-08-08T07:01:32.513974Z","submitted_at":"2022-11-15T18:50:34Z","title":"Evaluating the Factual Consistency of Large Language Models Through News Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08412","snapshot_observed_at":"2026-08-07T19:07:25.414178Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.414178Z"},"links":{"cited_paper":"/paper/2211.08412","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:d8c8446fa1b951442d10caae3d17d220590041f7b582e45806ecf767ce112c45","observation_id":"eb6d35b8-cef8-4e61-82b7-2004467e4f7f","resolution":{"observed_at":"2026-08-07T19:07:25.414178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:26.405170Z","title":null,"venue":null,"work_id":"7deb2fba-ea87-457f-a7bb-0be2d6559683","year":2018},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.421085Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:9ad7054db132860543145a4894ef43c88de3a48709028887848ad9583aa8a062","observation_id":"cc849c82-3175-4ab0-913b-26b928d99c6c","resolution":{"observed_at":"2026-08-07T19:07:26.433177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.425137Z","title":null,"venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.425137Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:c43d5876d7bc51248f6a055965037907e5a6bc3cfb8b1f9f71ede0f87300f380","observation_id":"86ff78fb-4582-4079-b070-c53680d4c48e","resolution":{"observed_at":"2026-08-07T19:07:25.425137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T19:07:25.429336Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.429336Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:860fddc79d2214220315a0e2e0b771269e52b8ac4946409b0fc23ff4be4d3e58","observation_id":"9ba79934-6a43-44e3-927a-48126c95bca5","resolution":{"observed_at":"2026-08-07T19:07:25.429336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.433908Z","title":"Vinyals, I","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.433908Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:abe1227a27e9551984a5b5a6036e8e62a497dcaecef491b80b4279c9f34f3acd","observation_id":"1ee40a16-25a4-4651-bd07-51b1109295b4","resolution":{"observed_at":"2026-08-07T19:07:25.433908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/mind/fzt012","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.491417Z","title":null,"venue":null,"work_id":"67dad127-a2cc-428d-a59c-e16a862a57d1","year":2013},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.437982Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:e0170ac77def02b68ce30ee728199e059cf6141be6fedee6e104cb6e1533e995","observation_id":"218db37f-57fb-4ea6-bc5c-381fbf37392b","resolution":{"observed_at":"2026-08-07T19:07:25.496759Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.441917Z","title":"Yamashita and J","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.441917Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:2e19826487a39d9a375730c546f708f9c64895252a7e5515ff6e3f59c0d6564d","observation_id":"8f1ca0b8-3041-4d76-a353-93973d99a0a4","resolution":{"observed_at":"2026-08-07T19:07:25.441917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"com/6266923","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:07:25.699668Z","title":"Yudkowsky","venue":null,"work_id":"9face468-43cc-41bc-9d91-8576d822c584","year":2023},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.446718Z"},"links":{"citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:e56c4d2852285a92902c7c5aa50473f54ffaf4f14c70dbee6fb2ab5a62cfdbda","observation_id":"ac7a4ff4-5507-4e75-8529-9f068298d984","resolution":{"observed_at":"2026-08-07T19:07:25.705668Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12491","last_updated":"2024-01-23T05:19:47Z","snapshot_observed_at":"2026-08-07T20:24:26.029336Z","submitted_at":"2024-01-23T05:19:47Z","title":"Assessing and Understanding Creativity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12491","snapshot_observed_at":"2026-08-07T19:07:25.450652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.450652Z"},"links":{"cited_paper":"/paper/2401.12491","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:749cf7e31f54d1c26c400a32018d628507f69951ee9577477fc9fd80b0c03f9c","observation_id":"c005c9ce-927a-41a9-a49f-f7ab3b8cf065","resolution":{"observed_at":"2026-08-07T19:07:25.450652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T18:58:17.901225Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":9,"verified_fuzzy":26},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 1 inbound Pith citation observation for arXiv:2502.10200."}