{"as_of":"2026-08-17T00:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f738a787402b584be9faf025fb7bea958789d80d15b02ad88ad95f4f8f66983","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:18:54.597741Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09770/citation-record","integrity":"/paper/2501.09770/integrity","json":"/paper/2501.09770/citation-record.json","paper":"/paper/2501.09770"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.370316Z","title":null,"venue":null,"work_id":"dabf050d-3981-418c-8694-3600a753a45e","year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.313630Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:58a375711e3beb92de9cf308289a1d7fa3296396059d8dbc0383026f700f3d32","observation_id":"65d770e9-5bc7-47fc-950b-56219e471179","resolution":{"observed_at":"2026-08-10T20:18:55.374622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.358591Z","title":null,"venue":null,"work_id":"f7906cc8-4d49-4733-b2bb-59737b25616e","year":2001},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.318332Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:d91eb85510e00286548b11ed383e1d8790f33fbacc8c12e6647eb5a62fca0002","observation_id":"f156f3b7-cbf4-452e-85cb-14ae345013a4","resolution":{"observed_at":"2026-08-10T20:18:55.362675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.346662Z","title":null,"venue":null,"work_id":"1cc19f32-9e23-428b-89f4-8251e30ac071","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.323269Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:312eb1eb4223d903ee7c471abc8e2387c3ac072a864cd52f13a675f33ff6ab73","observation_id":"a07b9c36-13ff-465e-b071-dc60579f4313","resolution":{"observed_at":"2026-08-10T20:18:55.350423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.334297Z","title":null,"venue":null,"work_id":"1a22fd0a-01a3-4eda-802b-c5e8ecf25f72","year":2024},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.327902Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:87e646cffaa887074f368c80c73f7e777dcaaf463b0d5767662a4575729879ed","observation_id":"ca618fa8-2300-4866-a12f-0e3a47d9101c","resolution":{"observed_at":"2026-08-10T20:18:55.338555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.322041Z","title":null,"venue":null,"work_id":"a42fa714-2050-4c49-813b-8043ce9e94e9","year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.332200Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b768d120c69e55754ec327edd0adcc69176811aadc63dd5fa5289a5d4de2ebfb","observation_id":"88b70520-196a-4406-90ae-1bf19bbd3e44","resolution":{"observed_at":"2026-08-10T20:18:55.325761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.309798Z","title":null,"venue":null,"work_id":"eb2609a9-4ab5-491b-aa4a-e543ff52ea37","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.336320Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ecfa3b9cc9efdebbdebdcb9f7ff8cda86e3d4ff514aa995d45d7f1ca73f2e619","observation_id":"feea5357-a9cb-45b0-9a44-15c7dd0c7274","resolution":{"observed_at":"2026-08-10T20:18:55.314279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.298665Z","title":null,"venue":null,"work_id":"e46c844d-d80f-40d1-8ad3-4c362bde0ab1","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.340860Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:51f37a8ea6def4f6876841948f5451a38ce8471e5e9861ba2164cf630f223e3c","observation_id":"50aa51f8-9cab-416c-b499-c05e5d1893df","resolution":{"observed_at":"2026-08-10T20:18:55.302385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.287035Z","title":null,"venue":null,"work_id":"ca5cfbe6-19e8-4175-89f7-3a0c3ce5f355","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.344791Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:bef0979d45c0779ba42eeeab6c0c1f4e6fbe7b93ba124ebe73239493af585562","observation_id":"ebe5708d-812a-4a64-8965-2b3baad95312","resolution":{"observed_at":"2026-08-10T20:18:55.290940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.274901Z","title":null,"venue":null,"work_id":"bd072d33-457b-4610-b899-3a9b474f427c","year":2022},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.348651Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:3f46cbea77ecd00663d6ba4e958db69df624129def8f42d65bc78afc63d31b1b","observation_id":"879fea58-6bb7-4c52-9269-cde671cbc813","resolution":{"observed_at":"2026-08-10T20:18:55.278607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.352488Z","title":"G.; Naddaf, Y.; Veness, J.; and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.352488Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:155e236026de9081a3a1cb01291e2e2a9a021fdb57114171a74c054aee11b730","observation_id":"86069253-4b17-4c11-95c1-f1fe5300e620","resolution":{"observed_at":"2026-08-10T20:18:54.352488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.356499Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.356499Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:17ed2a79532f871a9229a7b3f2d56b54659fbc09ae6441e829b81c80482a317c","observation_id":"cd5f2deb-9a95-4181-8301-1e3f6b9c05ee","resolution":{"observed_at":"2026-08-10T20:18:54.356499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.250425Z","title":null,"venue":null,"work_id":"a3919ee2-53eb-4bc6-8667-6981df4c33d9","year":1962},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.360440Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:2dc0ed621dfc203436f63ccee6c8b962f655aa5e6e3926ef228c6fdf2533fd4d","observation_id":"a889e45e-3dce-479e-ab19-7d967a3ba9c8","resolution":{"observed_at":"2026-08-10T20:18:55.254233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T20:18:54.364241Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.364241Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:225cd46c4d619ba5451735cf776f985cba7193b124f3597d0bcded2781595504","observation_id":"2abebcd0-5ef3-4334-9b86-c337e6e2508f","resolution":{"observed_at":"2026-08-10T20:18:54.364241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.237950Z","title":null,"venue":null,"work_id":"6709fce5-c77a-4276-896c-9362a8b5a581","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.369259Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:014dabc7709d619b21e2966a45075494c6843a96f56e4cd514d284acdb2c0de8","observation_id":"a63e3685-30ff-4ebc-b2d4-762dc7badbfe","resolution":{"observed_at":"2026-08-10T20:18:55.242743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.224816Z","title":null,"venue":null,"work_id":"3abd8d60-a391-4796-ba17-02a28727bf32","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.372900Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:6a0401f8cddf0793fbdce9a497eb165f9c4fc47e5704d7b071fbd5e7fdc37c83","observation_id":"abcebbd3-62dd-4e1e-95e9-f262da025bdf","resolution":{"observed_at":"2026-08-10T20:18:55.228668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.213419Z","title":null,"venue":null,"work_id":"bafa1764-a74f-4475-90aa-0bd34dedd73c","year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.377257Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:f0502ede232db47fbf37c37f3b2beb8fbe614d49fa8dd09d6ed429f627165979","observation_id":"a124ca8f-debb-4652-9c48-88a42549a1c6","resolution":{"observed_at":"2026-08-10T20:18:55.217126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.201383Z","title":null,"venue":null,"work_id":"424e6fe5-29db-4ff4-9d7f-b5c916a7c3d9","year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.380476Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a4d8f41d938a4925b1c8fe1c543ffec26cfe65ba91aa9fc35bb7ff499025f4e0","observation_id":"41d9c10b-6d9f-4f37-baf2-c5fc5406c579","resolution":{"observed_at":"2026-08-10T20:18:55.205954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08920","last_updated":"2021-08-03T11:20:08Z","snapshot_observed_at":"2026-08-16T19:12:43.567344Z","submitted_at":"2020-10-18T05:06:01Z","title":"Average-reward model-free reinforcement learning: a systematic review and literature mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08920","snapshot_observed_at":"2026-08-10T20:18:54.384396Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.384396Z"},"links":{"cited_paper":"/paper/2010.08920","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a7962a1a153b10fb14b7025cd69a246b99f9f6a81ec424f76da1e907e97eed8c","observation_id":"61bb5e79-6577-4381-80f8-ff3ef6ca5e0b","resolution":{"observed_at":"2026-08-10T20:18:54.384396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.189852Z","title":"M.; and Mansour, Y","venue":null,"work_id":"980b624c-f030-4c8a-aecf-5a33846d97ef","year":2009},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.389194Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:e5f4660dc7b66bb46c823ee212d655de0cd22e246efad4ad71c807ea8ca53cb3","observation_id":"85c937ff-9500-4fbc-80a9-e13348d6ab5f","resolution":{"observed_at":"2026-08-10T20:18:55.193576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-08-14T19:45:07.867570Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-10T20:18:54.392632Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.392632Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:77a913081f3c641f6d80d7bdbc2a230881d5a7daf6979a268b548e398eb24e46","observation_id":"aa675ee4-7f61-4263-9fa7-9ac82e55c090","resolution":{"observed_at":"2026-08-10T20:18:54.392632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.178504Z","title":null,"venue":null,"work_id":"61abd6b0-40a0-4add-b19d-cfd7cc7eb063","year":2022},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.396342Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a2044ef4c573017f19dca4f175e60c03d0f8528be5f7d6840d9bee68152fcde2","observation_id":"8e5d70c6-72d5-4776-9dba-d7ed222a10c9","resolution":{"observed_at":"2026-08-10T20:18:55.182376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.399568Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.399568Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:1932f17fbe0e2e67396034d06479e034e673385039a556cef4f8cfdaf94e1d3b","observation_id":"b94206cf-4d6d-4878-beb2-d51cbe5ed083","resolution":{"observed_at":"2026-08-10T20:18:54.399568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.160428Z","title":null,"venue":null,"work_id":"42f65bc6-b339-45f8-a081-2064ec8d6413","year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.403177Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:360d5695707c66745f91efe7a6b8491bd5d16a39f2c42f21788726f53b5d1842","observation_id":"87d157fc-3e76-43ff-8c41-830ab3843644","resolution":{"observed_at":"2026-08-10T20:18:55.164191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.148319Z","title":null,"venue":null,"work_id":"f902a218-c6c5-4b45-9f8f-2147c8391aa4","year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.407089Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:052353991a74e735bfd516cc82119ae2d764c89000bb373243b58bea47b01bc2","observation_id":"4638b31c-b369-44af-877c-139da08982f2","resolution":{"observed_at":"2026-08-10T20:18:55.152729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.410677Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.410677Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:39fe1b4cf19b7f2460e9006102d4d45435a110290f6bd7fadc7938799f758d8d","observation_id":"3be3e702-7077-4048-be0f-1dd71cfe77f9","resolution":{"observed_at":"2026-08-10T20:18:54.410677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.128566Z","title":null,"venue":null,"work_id":"e9cf351f-3524-4849-a709-e0db29da6874","year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.414485Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:14e320ab79fed3036897fd178d08acf5b6f827bc3af96cdcb11d4868bb9dd220","observation_id":"7e1f4295-c1cc-4fe7-82d6-e0b1b67eb407","resolution":{"observed_at":"2026-08-10T20:18:55.132490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.116642Z","title":null,"venue":null,"work_id":"01fba834-2026-4c7a-ae40-674dbbf17613","year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.418061Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:19523d635d825e72ee7bb0236823dbb5bbe115c712af53809d94de2bf46c06e0","observation_id":"e6ad8b45-0f26-40ed-90d5-aa09116e6781","resolution":{"observed_at":"2026-08-10T20:18:55.121091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.104409Z","title":null,"venue":null,"work_id":"c20eb714-f4fa-4077-92ab-60a759fdfafc","year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.421827Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:4ac77bf4d5e79bba8488d2b8e61edf42d4fc5a525801fee3d4a3f7d6fb506505","observation_id":"3f215f5b-49a2-4c8d-aec2-2e0d5694df79","resolution":{"observed_at":"2026-08-10T20:18:55.108632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T20:18:54.425456Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.425456Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:bcf6cacd44551d8b9d6f436b9aa5012db043d505988135c32492e7ca466e316f","observation_id":"53921fef-0e5d-4d86-b9f4-831f18812bc0","resolution":{"observed_at":"2026-08-10T20:18:54.425456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-10T20:18:54.429473Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.429473Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:d59343e7fed6f8780d02c9faa703ed2ed8f65cb106c379a90be6756c897deccc","observation_id":"7a007c2f-6858-4cb2-bcf9-bb79a7a3c96a","resolution":{"observed_at":"2026-08-10T20:18:54.429473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.092984Z","title":null,"venue":null,"work_id":"99bf5de3-64f8-41ef-97e2-78594c84a012","year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.433593Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:1e11662df0ab45a3175f4d7cfe37e80a61d9e212439c1fcddd394ad5b0c0541a","observation_id":"7952512f-7e42-40b4-96d5-bf6f49fe4b9d","resolution":{"observed_at":"2026-08-10T20:18:55.096820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.438405Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.438405Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:70e71d2a136bbfaba3819722ce36071b218f9d1122453553736681bb8bdc3390","observation_id":"db433991-9ac4-4e10-8020-8942c2e48303","resolution":{"observed_at":"2026-08-10T20:18:54.438405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.074378Z","title":null,"venue":null,"work_id":"bd699ded-c836-4239-a25c-6f01bf66f2a4","year":2003},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.441755Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a48b8f185cb2dadc34ea715f8ab8e8d9e7daf58aa3ac71c1de47c847c815b31f","observation_id":"4af9e5de-ad97-43b5-87ae-eaed28f65d8e","resolution":{"observed_at":"2026-08-10T20:18:55.078196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.062194Z","title":null,"venue":null,"work_id":"7e72e658-dcb9-4b6d-8d46-85e2d8d43ad0","year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.445012Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:1475a62d0bf6269103e265fda3996dbafe3fa478f4417a9001273deb6a6d895e","observation_id":"b23ec61d-2372-4b91-8ac8-b45e9727cea7","resolution":{"observed_at":"2026-08-10T20:18:55.066601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.049894Z","title":null,"venue":null,"work_id":"2dcc4970-1dec-45e7-a12a-7b77389f3c5c","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.448681Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:41677587f3771b908ce8654d1129ac593c0fd0af66783548a282d048456d22ac","observation_id":"58b1a80b-5124-4167-9622-7ee9eeb8e321","resolution":{"observed_at":"2026-08-10T20:18:55.053650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-10T20:18:54.453908Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.453908Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ff3bde81dddfa13684dcc28a584eaa1cb8c8638c79c3bed5746cee3ef3ef2a67","observation_id":"7a730476-9bc0-4164-a40b-117398ffa75c","resolution":{"observed_at":"2026-08-10T20:18:54.453908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.037750Z","title":null,"venue":null,"work_id":"65540c22-d106-4397-9711-38e1dc5d214f","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.458168Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:4cf848829131e4db6a26c6f001fcd206378822c8b3f6d971b122519b890713bb","observation_id":"cb525d66-3249-406b-89e6-7c5e3ef22a28","resolution":{"observed_at":"2026-08-10T20:18:55.041856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.025250Z","title":null,"venue":null,"work_id":"fee60c88-a1be-4ac0-9552-1e4558764d13","year":1996},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.461642Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a3d077d24ce64da0be428ba49aaf9f1f95583df259960731449f0c336da04a7b","observation_id":"c3703139-9a53-42a5-84a5-b540007b3efa","resolution":{"observed_at":"2026-08-10T20:18:55.029182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.013525Z","title":null,"venue":null,"work_id":"4fbfcbd8-b16e-4a83-a9fe-d936a0b1ca2e","year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.465764Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a03d78bdcba6e658606d8ed7b8d8e3c5647e13ed5936520dd3f0772668acf3b9","observation_id":"75e994bd-14fd-4c55-85bb-be63010d9555","resolution":{"observed_at":"2026-08-10T20:18:55.017598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.001233Z","title":"K.; and Newton, N","venue":null,"work_id":"823bb0d9-dfe6-4b49-94c4-49c5e5aa27e1","year":2000},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.470418Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b2a90fb143ed70c390cb7d8aae6f3cf9bd1a10c4bdf619cee0d58448941c0473","observation_id":"1869761b-2929-4f8a-abfb-2d7c12233edc","resolution":{"observed_at":"2026-08-10T20:18:55.005357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.473687Z","title":"A.; Veness, J.; Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.473687Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:13e1c04ce9e3a1170238fb9f9698869353e0d6853936e210302220ebb3918487","observation_id":"5742ce71-65a8-4641-83cd-1fb69ecb2f4f","resolution":{"observed_at":"2026-08-10T20:18:54.473687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02140","last_updated":"2019-11-27T07:28:55Z","snapshot_observed_at":"2026-08-16T11:00:12.765456Z","submitted_at":"2019-10-04T20:52:39Z","title":"Discounted Reinforcement Learning Is Not an Optimization Problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02140","snapshot_observed_at":"2026-08-10T20:18:54.476829Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.476829Z"},"links":{"cited_paper":"/paper/1910.02140","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:02baf846b9de2101a4ec7b4812dffb7add6ed7a06ff1d3e6761f3ba6cbc28500","observation_id":"22b76259-2cec-4a0e-bbd6-fe5c3402b724","resolution":{"observed_at":"2026-08-10T20:18:54.476829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09999","last_updated":"2024-10-30T14:18:42Z","snapshot_observed_at":"2026-08-16T13:52:12.826060Z","submitted_at":"2024-05-16T11:33:49Z","title":"Reward Centering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09999","snapshot_observed_at":"2026-08-10T20:18:54.482883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.482883Z"},"links":{"cited_paper":"/paper/2405.09999","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a3dfcb0fe3e1860f629e96ffd373d037eb0577d694449732585521ab907aec3e","observation_id":"9bf000a4-bd3c-420e-ba75-056e82a177dd","resolution":{"observed_at":"2026-08-10T20:18:54.482883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-08-14T20:59:03.934741Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-10T20:18:54.487766Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.487766Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:6dc213d6dcb31882aea2fa50b1ab31e7cb67413fe5da6fae4aae9b4e96321000","observation_id":"111e04c3-a567-40db-b16e-d57933c0b389","resolution":{"observed_at":"2026-08-10T20:18:54.487766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.981649Z","title":null,"venue":null,"work_id":"95696cf6-c72d-400e-b8a6-d8601c7daeb8","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.492473Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ff7ab3e770e66a9adebcc1d54cadd1180b65582cd2ca949160ced1a3a7a84faa","observation_id":"5ccac08d-ad7c-4eab-bed1-8ef71ac96a5f","resolution":{"observed_at":"2026-08-10T20:18:54.985492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.496400Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.496400Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b47649e9b20fd4e8fdefc81faea1cc5ace37a10e0fccc58739d639e92ce5ef73","observation_id":"a870d33b-c17a-4ed0-b668-edcfa3c1bef6","resolution":{"observed_at":"2026-08-10T20:18:54.496400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.963026Z","title":null,"venue":null,"work_id":"3023cc20-321b-4e6c-8af6-3743f9a47762","year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.500783Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:f76850347955a4819a1e8a16c465d8c4495229cf5c65b281da65b4ccfcac752d","observation_id":"87c3423a-461c-452e-b9fe-40aaf4ba58f5","resolution":{"observed_at":"2026-08-10T20:18:54.966692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.951577Z","title":null,"venue":null,"work_id":"6f11a48d-3847-4d20-a600-4fe4457c371c","year":2013},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.504210Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ee9777e8b3e6fe76df1876130c6c6d948b0ef6bff5787984a6b084eadb7033b4","observation_id":"c0b1466c-e5da-4b5e-a3f3-b687ac8d5c94","resolution":{"observed_at":"2026-08-10T20:18:54.955565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.939349Z","title":"C.; Mair, J","venue":null,"work_id":"007c097c-8fba-42a5-9da2-982e135cd7bc","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.508063Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ddccc6c331e7f2bd6d2a75725bbb88518b6d3ddb7a3ca9da47becb854261f61b","observation_id":"949c2678-3f98-4d5a-a508-59f02b562ec4","resolution":{"observed_at":"2026-08-10T20:18:54.943786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.926823Z","title":null,"venue":null,"work_id":"73a5cb7f-d536-4680-a424-989658a9f30b","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.512479Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:74b426cd2231e73c04689d49f26de52186379d59844c1305844f7e76e1c6cdbe","observation_id":"4499b207-21a6-459b-92bf-07e0d3de518c","resolution":{"observed_at":"2026-08-10T20:18:54.930886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.914607Z","title":null,"venue":null,"work_id":"87bdd9bc-bb09-471b-9bce-69b9954f35ed","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.516923Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:1b79ad8c173ae6f642c220cff5e450fe8ecf96fa1f2f168a78b354d351823a52","observation_id":"770443fb-61ac-4be5-8c01-cf74987f1b98","resolution":{"observed_at":"2026-08-10T20:18:54.918800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-10T20:18:54.521239Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.521239Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:3c3fd69b61db3f7bbd9bf020af64f68e3bb6be3c750d55355fc5ffc0ba48d411","observation_id":"2a4a229c-1ccd-45c0-b8af-fd9c29fe5b23","resolution":{"observed_at":"2026-08-10T20:18:54.521239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.526211Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.526211Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:c6c7978e50f0abd4665fe0ceec73faabff02820b226d52deab178b7d1fd152da","observation_id":"7f7b5860-2472-4b40-8864-ed50d4e6efbf","resolution":{"observed_at":"2026-08-10T20:18:54.526211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.894947Z","title":null,"venue":null,"work_id":"40c8d13d-44e3-4327-82c5-64794ea8308a","year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.531186Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:f3701324e7eb6bd67b50fa30d2d7f9de15ba035400dbfef059b54060228181d7","observation_id":"ec40481e-256f-4220-842e-04daaaf865ec","resolution":{"observed_at":"2026-08-10T20:18:54.898945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T20:18:54.536098Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.536098Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b1b8dede53680292465729e11538281b8c711ce6de16978ff6a34eb8a9e5ea81","observation_id":"dc9436b0-d88b-4aaf-b255-8f4658f681c3","resolution":{"observed_at":"2026-08-10T20:18:54.536098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.883180Z","title":null,"venue":null,"work_id":"3847006d-3cc8-4041-9119-a2e246294aad","year":1993},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.540806Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ab520e4765c102c3fc1805468b839fb6701556f31beb2fd27bc5f8891d25ae10","observation_id":"75fa68d7-60f3-4b8e-9569-98e81b206c6e","resolution":{"observed_at":"2026-08-10T20:18:54.886996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.544530Z","title":"S.; and Barto, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.544530Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:052c6d09e4fa3db3b765c031094ffe4aa346b07a1e72e29a6b02502c13428557","observation_id":"4e44a114-19f9-443c-bcdc-59fd10dc69ab","resolution":{"observed_at":"2026-08-10T20:18:54.544530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.864643Z","title":null,"venue":null,"work_id":"5472fa41-9c90-428a-8682-202dfeda1898","year":2006},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.548253Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:3fd2ed434a5d30fdbcc3db7285942626b9092f814b9882ec6f066321661975eb","observation_id":"c9f5a6eb-b09b-4a80-a36a-25027dc3cdb8","resolution":{"observed_at":"2026-08-10T20:18:54.868629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.852780Z","title":null,"venue":null,"work_id":"4d860a40-1d95-40e1-884c-295c8fdc6bc6","year":2009},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.552125Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:8e022d16ff6c53c10bbba2866ac43ab3b70657f7fcb78a23b5b6dd80065fa264","observation_id":"bcb311e6-9896-4bfc-8f7f-95be05e65238","resolution":{"observed_at":"2026-08-10T20:18:54.856929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.556613Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.556613Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:39618216c529d38606f2145b368b661a8854ebadf2242972c47c16a2a71346f5","observation_id":"b9f883fe-e60d-4126-b993-85db6a1b726a","resolution":{"observed_at":"2026-08-10T20:18:54.556613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.834368Z","title":null,"venue":null,"work_id":"1b8b170d-306a-4e66-b65e-574f9cf1fc26","year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.560556Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:f856cea51ef5ebaa498620b8b36ccca5426734451c80d222c1d7222a31193d9a","observation_id":"6772184f-8927-476e-9270-f26ec4f5dcf0","resolution":{"observed_at":"2026-08-10T20:18:54.838236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.822545Z","title":null,"venue":null,"work_id":"0c5785a6-8f98-41a2-a2bb-27dc0bb82ef6","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.564467Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:476747d4794fc89efac0573823c1a1b7715f96590319cb33b59bf64312bef646","observation_id":"8f14e4ff-d88f-42af-8844-0836f186af89","resolution":{"observed_at":"2026-08-10T20:18:54.826468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.568957Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.568957Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:65e9022d0a56baa62af4d96bf9e6b5683fb88d1d11c38cfcf26034d8b60c0eba","observation_id":"b10087f3-6874-4fbb-b797-598d393d799c","resolution":{"observed_at":"2026-08-10T20:18:54.568957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-10T20:18:54.572916Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.572916Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:3bbbd8c16252ebb8330c57e7255040377f5adfe68a2cb8f974fe39bfd9d30457","observation_id":"68f62f4b-696f-4f6a-a182-d5eff2487548","resolution":{"observed_at":"2026-08-10T20:18:54.572916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07927","last_updated":"2024-10-10T13:54:11Z","snapshot_observed_at":"2026-08-16T13:10:42.494756Z","submitted_at":"2024-10-10T13:54:11Z","title":"Efficient Reinforcement Learning with Large Language Model Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07927","snapshot_observed_at":"2026-08-10T20:18:54.577941Z","title":"B.; and Wang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.577941Z"},"links":{"cited_paper":"/paper/2410.07927","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:0bd0b08d5d2a6c1d4fa6b7f1c5f27b6013d0279928f273e0fa1573218796e347","observation_id":"09abbb62-d7e7-4cbf-a5e4-31b3312d8702","resolution":{"observed_at":"2026-08-10T20:18:54.577941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.804539Z","title":"S.; and Whiteson, S","venue":null,"work_id":"a59a1b85-df32-4a52-b28d-78345ac6d856","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.582535Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:568c4f7965a15b9544bc11b762a17b978a86922018e2cbcbcc405ca6065e6417","observation_id":"8ac8a3bf-ae73-47ec-af3a-33bd3bfe468c","resolution":{"observed_at":"2026-08-10T20:18:54.808252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.791262Z","title":null,"venue":null,"work_id":"649b5f4a-ddd9-4770-bb72-d1277c2aeb0f","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.586455Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:dacb506f821ce86b66a03a7a6bc55aa0db40aea6817af49362850ed9a5b8740a","observation_id":"3e886caf-b271-4b97-8be2-7cdd825d1b5d","resolution":{"observed_at":"2026-08-10T20:18:54.796128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.778078Z","title":null,"venue":null,"work_id":"10aa5b98-2667-4276-887e-90ee7c254795","year":2010},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.589974Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:bc8dd3e82f9947096e1c497e039d4d6838fca9c1a20cd8c4f8f58b7b9b35df1f","observation_id":"232803de-c52a-4a92-9698-5c018e02d7a1","resolution":{"observed_at":"2026-08-10T20:18:54.783240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.593465Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.593465Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:5eab46ed8355c5246e2549eca9957cbe47ce3767db47be17c0f8291394024806","observation_id":"04656e05-a9f1-467f-8402-827a19e0fc9c","resolution":{"observed_at":"2026-08-10T20:18:54.593465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.597741Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.597741Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:9725afe4790f55af95c23169bce43258018a9db99de7040747f7fc241c514a82","observation_id":"fe2cf2fe-4046-41e1-a41b-8112427efa53","resolution":{"observed_at":"2026-08-10T20:18:54.597741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2501.09770."}