{"as_of":"2026-08-13T12:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:868d2bf964f6e096cb56c06c00c9e63d090b2485bbc13d0c3a2f1ae8ec8488d5","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:42:59.250552Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:42:59.250552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T15:42:59.404858Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"cited_work":{"arxiv_id":"2411.14019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14019","snapshot_observed_at":"2026-08-12T15:42:59.404858Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","venue":"cs.LG","work_id":"9944123c-3a73-4ecf-890c-1448550831be","year":2024},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.250552Z"},"links":{"cited_paper":"/paper/2411.14019","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:9202dff5c5da1fc61a9cf89b4a422ffbb8841af5a2ab82299e0c4c10714cf98d","observation_id":"96c5fc6b-ea2c-407a-b573-4d9f66b394f2","resolution":{"observed_at":"2026-08-12T15:42:59.410682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14019/citation-record","integrity":"/paper/2411.14019/integrity","json":"/paper/2411.14019/citation-record.json","paper":"/paper/2411.14019"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.123943Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.123943Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:24c9101027787008039b953fb50ee462e1fbc884ded2be58ec9fb94204ae3126","observation_id":"b5c84053-f80e-4b8f-84c1-453c19f3cc2e","resolution":{"observed_at":"2026-08-12T15:42:59.123943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.741460Z","title":null,"venue":null,"work_id":"a795e96e-b8ef-4e96-a7ba-7dc87e231355","year":1997},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.128254Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:cee2d048b5fc11666986c59b35e15281f54ed20f1881efc72d75c3d0f15d6c27","observation_id":"ecdca55a-7bb2-4742-aaef-1a34505bbcd0","resolution":{"observed_at":"2026-08-12T15:42:59.744959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-12T14:28:10.961989Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T15:42:59.132112Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.132112Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:4e3ac6928461c489fb70cd85d4abd8bd3cebcc27db6004104f5ac01a88843fc4","observation_id":"381d1499-5fe6-4378-a685-f75d8aa4fea9","resolution":{"observed_at":"2026-08-12T15:42:59.132112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-12T15:42:59.136421Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.136421Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:ada2ee3664ddb4b76e3a36f9858855796875c60e6766ed2356e526610313321e","observation_id":"24cd254b-6099-4857-9682-86463961ca40","resolution":{"observed_at":"2026-08-12T15:42:59.136421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.731088Z","title":null,"venue":null,"work_id":"46f71f48-56f7-49f1-8442-1e90d7bd2a88","year":1992},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.140358Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:79ad0890241408b087af09448aede0cdd15cd56ed9e9be64b95a0e9b6b593e27","observation_id":"24576388-8192-482d-9d48-c44095a59020","resolution":{"observed_at":"2026-08-12T15:42:59.734943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.721261Z","title":"& V an Roy, B","venue":null,"work_id":"3a0e0489-8fa8-4ac8-b5d0-047642ab7f83","year":1996},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.144006Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:ff065d46786abc130f5d47e20136bb8fc3e97925e6835152373488255a16149b","observation_id":"fb9eaa60-77f6-4d12-9569-17dc64c5a582","resolution":{"observed_at":"2026-08-12T15:42:59.724610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.711052Z","title":"& Williams, R","venue":null,"work_id":"952c1a72-fdb8-42c1-8771-ec3b4c323b56","year":1993},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.147694Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:385e58ab523167906e7e859fe86a6dc262d5e5ee0abaef4a4a348345b6967fec","observation_id":"99d7a4e1-9531-47c0-9a6c-36dc7f0e74f7","resolution":{"observed_at":"2026-08-12T15:42:59.714635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.151129Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.151129Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:07cad4a71da220ab27316b565c93ade80ebc00cac52944901e6f79a24eb031d6","observation_id":"83f9c814-d6f3-4b7a-a427-2955f06f1e62","resolution":{"observed_at":"2026-08-12T15:42:59.151129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.693822Z","title":"& Sutton, R","venue":null,"work_id":"58cd6e78-517b-474c-b4ea-02a4e92e0f72","year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.154534Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:bdf960d15e89f177752eb49a9ab5c74319e480302764531253c031ea5620dca5","observation_id":"6aca79d4-1d02-4420-aef9-2238ca940b1d","resolution":{"observed_at":"2026-08-12T15:42:59.697294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.683949Z","title":"Algorithms for reinforcement learning (Springer nature, 2022)","venue":null,"work_id":"09a79892-88c8-4560-afe3-5c82e69011d2","year":2022},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.157947Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:9b2992d194ee3f2b7683b817d2253ef6e47b6d42d3f4812451d1a7cc9b45928b","observation_id":"f87e1e2e-1a36-4a68-acc0-825f438294a9","resolution":{"observed_at":"2026-08-12T15:42:59.687679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.673282Z","title":null,"venue":null,"work_id":"99c87e22-5050-41f6-b405-d90c71400402","year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.161517Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:90639664466d7db7f270fc1ac76bdd94076b1d0e21bbd1926add6e26965da847","observation_id":"7a9d7340-920e-4246-9be3-e5a2dc69fb58","resolution":{"observed_at":"2026-08-12T15:42:59.676781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.663204Z","title":null,"venue":null,"work_id":"30c261fb-8bb8-4014-8f84-277d8d2f5935","year":2000},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.164937Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:07321ff72adc12d5cede5081ab47e0a814915ec50aef36d06afb797a16414a09","observation_id":"32a26af1-7437-4fd2-8094-5ba61c633612","resolution":{"observed_at":"2026-08-12T15:42:59.666649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.653379Z","title":null,"venue":null,"work_id":"088414a8-eb67-4cdf-87bc-8f0ff705a8d0","year":1984},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.168279Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:01fb34c9a0c28d5160ebe8da5724cf8326f6cf60c882c80621de14a1d4a76379","observation_id":"9e936308-dedb-45db-bfe0-127856906239","resolution":{"observed_at":"2026-08-12T15:42:59.657054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.643224Z","title":"& Silver, D","venue":null,"work_id":"02c6d31e-6742-43d7-b150-632cbb215e32","year":2016},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.175545Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:7fac6092e7fcb1cbb3d7eda917b91cc5e520c74c19ce8a1208dc5a81361dd8cd","observation_id":"cec608e5-bf70-4f60-aa52-e78108fc2ecd","resolution":{"observed_at":"2026-08-12T15:42:59.646626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.632858Z","title":"Error bounds for approximate policy iteration","venue":null,"work_id":"73760fcf-104a-4ad9-a7f4-86f631f97454","year":2003},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.178859Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:2a9de45983239c3382514ff98535290f4c698a85853231202b606b82cc5f4eb9","observation_id":"b2894724-a0e9-4ba2-9528-9381dd00129d","resolution":{"observed_at":"2026-08-12T15:42:59.636542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-12T23:53:55.764215Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-12T15:42:59.182279Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.182279Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:9fb903fc5d34411380845c9edbd430fc9aaf40af94e5d8199037664b52dc2575","observation_id":"5391d55f-7134-4852-851d-8a29e11141e1","resolution":{"observed_at":"2026-08-12T15:42:59.182279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.622285Z","title":"& Pilarski, P","venue":null,"work_id":"063dc017-4518-4218-a649-284d9e639a69","year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.185862Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:f0a865b75c37e67ec22c1f5217780c38f81845d7aface96b7f854916939eb9d1","observation_id":"76a94055-7c46-4536-8752-8daad7f98cb2","resolution":{"observed_at":"2026-08-12T15:42:59.625890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.611708Z","title":"& Wen, Z","venue":null,"work_id":"ca1880fa-cffa-4bb4-a399-936eb8ad6d16","year":2016},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.189256Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:bc2cd9e1ff488d64b92e18d292415da0cbbec4d9e48c32f8bc86acf071380cd9","observation_id":"9b2e9293-a66c-4e0a-a9e8-bf86c7793da1","resolution":{"observed_at":"2026-08-12T15:42:59.615362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02011","last_updated":"2016-01-20T10:33:00Z","snapshot_observed_at":"2026-07-06T04:38:59.730187Z","submitted_at":"2015-12-07T12:25:18Z","title":"How to Discount Deep Reinforcement Learning: Towards New Dynamic Strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02011","snapshot_observed_at":"2026-08-12T15:42:59.192879Z","title":"& Ernst, D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.192879Z"},"links":{"cited_paper":"/paper/1512.02011","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:553aeadadc22796ba889b59751f365e10a15d081e73d6ab189a6ad5cd62f46f5","observation_id":"4e491de7-3065-4406-9cef-a33d81355653","resolution":{"observed_at":"2026-08-12T15:42:59.192879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.600705Z","title":null,"venue":null,"work_id":"2c860e18-1637-436a-9eeb-7596accc931d","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.196488Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:502a6eeed61f3a09f981c5adb943e03ad8029b13e4f32478df5e70f9a81d1425","observation_id":"3e042fc0-aab3-41b1-8c54-9faf9ea65bcd","resolution":{"observed_at":"2026-08-12T15:42:59.604663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.589014Z","title":"Optiongan: Learning joint reward-policy options using gen erative adversarial inverse reinforcement learning","venue":null,"work_id":"90584d29-c622-4499-9824-ab9439b69b47","year":2017},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.199768Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:d801c3e4807a8e37bcab0721151ed2402ff1b9c9a3c982828fdc72a3dd132ecf","observation_id":"15c7bbf3-4bd7-4f00-991f-56d3cfba2e47","resolution":{"observed_at":"2026-08-12T15:42:59.592919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.576916Z","title":"Discovering hierarchy in reinforcement learnin g with hexq","venue":null,"work_id":"a7c09cb8-014c-4fdd-862d-41e4c65cf10e","year":2002},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.203160Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:70f587eb87818fdefea53960998d663405204c93fd051c58a1292b1b67da719d","observation_id":"25bf3420-43d4-42aa-a0ea-de2cbe694ad5","resolution":{"observed_at":"2026-08-12T15:42:59.580832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.566178Z","title":null,"venue":null,"work_id":"d72d630b-e298-4d34-b28e-05a433870d8a","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.206660Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:2da31c9798828280dff241d2f81bc1d89dc5ba0011475b0abd11657a0d860e1a","observation_id":"0de67471-4fdf-4303-af8b-bdaa098d74ad","resolution":{"observed_at":"2026-08-12T15:42:59.570128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.555255Z","title":"& Shimkin, N","venue":null,"work_id":"c84085c5-3ccc-4d53-a3ec-0ce5bd5fa00c","year":2002},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.209835Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:4f0e7457dad4b40ee251a86c2accb6aa3179d4fec1b1fd59a5ea9851ccb10600","observation_id":"2ee35c95-28e3-4b5c-9f77-d23cdeac66fd","resolution":{"observed_at":"2026-08-12T15:42:59.558865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.543846Z","title":null,"venue":null,"work_id":"0de0100d-f113-4a17-aa8b-e8e9c6649630","year":2003},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.213035Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:c5b0d2acea914ae7fa0a54c81fb84c2af23c7ea702653f6750c87e1afdb83a27","observation_id":"f9f7ba4d-e162-4c3c-94cd-6b9179d2d483","resolution":{"observed_at":"2026-08-12T15:42:59.547755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.216225Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.216225Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:16efc8ec39f9249751702afd955f86e8d38a86c8ccafdc82f12d48a43ce1d2f0","observation_id":"08db37ee-5cc7-4356-ac02-a81ee85b08a1","resolution":{"observed_at":"2026-08-12T15:42:59.216225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.526224Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"961cd8b5-18ed-415b-bc89-933f3718bfd1","year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.219702Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:15cecd5e4daef1e530b7139663a2120575eeaa32d6d2b8ccb467389397db0b56","observation_id":"107ff731-acc9-4c2d-a8ee-4c29de087b79","resolution":{"observed_at":"2026-08-12T15:42:59.529899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.223137Z","title":"A markovian decision process","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.223137Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:2c836d75463043693839721c6b8f72b010a774cb956aaf89418216a2bcaf38fb","observation_id":"4e8acf22-2e3c-486b-a08d-25bec08e83d0","resolution":{"observed_at":"2026-08-12T15:42:59.223137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-12T21:29:36.308819Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-12T15:42:59.226498Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.226498Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:ad230243f821546fb67a8c7d89d090b057457203a68cce6cb8cbf9f5df5e98b8","observation_id":"a7040e14-bba6-4992-a7ad-7b1cee181c07","resolution":{"observed_at":"2026-08-12T15:42:59.226498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.509763Z","title":"S., McAllester, D","venue":null,"work_id":"1f100b20-4725-485f-984e-35bf7e1151f8","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.229784Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:021f62348e4235aaa0c75338c7ae48cdd2df094f00197416c9348de828a5f7d1","observation_id":"e20b45e4-f732-4a9c-b065-32c7bdef6a0b","resolution":{"observed_at":"2026-08-12T15:42:59.513143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.499924Z","title":null,"venue":null,"work_id":"8ea39132-8d86-4a31-83f9-66c51d752a17","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.232992Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:734cec79f77bbf5af8e6626380436ec193311c038edfa4c44257d7325e7cc803","observation_id":"5ebf1381-c522-491a-b65c-3f76c5b8b3e9","resolution":{"observed_at":"2026-08-12T15:42:59.503178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.236178Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.236178Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:9e79f643da8229a31bb7ea2c2bb7563442b0f3982fae3d7d544da7b02285c5b0","observation_id":"ff5edea6-8a09-4782-aeef-b1888b8d85ab","resolution":{"observed_at":"2026-08-12T15:42:59.236178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T15:42:59.239471Z","title":"& Klimov, O","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.239471Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:b3aab6cffefb9a3a9ff9a4f8d5500d314bac5764a0f4e618cbba072cb9c4dfbf","observation_id":"f2de305b-222f-454b-8927-97ea947fc5d7","resolution":{"observed_at":"2026-08-12T15:42:59.239471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.243122Z","title":"S., Barto, A","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.243122Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:1c6a4acde59a49724c3a347c14f4afb1fbb16063363e51fc9bf06dced053ff33","observation_id":"870b958d-5b33-4066-97d1-fdef6dbd1879","resolution":{"observed_at":"2026-08-12T15:42:59.243122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02525","last_updated":"2018-10-05T05:52:49Z","snapshot_observed_at":"2026-07-06T07:06:15.247487Z","submitted_at":"2018-10-05T05:52:49Z","title":"Where Did My Optimum Go?: An Empirical Analysis of Gradient Descent Optimization in Policy Gradient Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02525","snapshot_observed_at":"2026-08-12T15:42:59.246831Z","title":"& Pineau, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.246831Z"},"links":{"cited_paper":"/paper/1810.02525","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:dbae755b2e99b314cccc69dfca044b7e6f23ff96d4ab5560957da4f3b8d106e3","observation_id":"e860f8dc-57df-468f-a7eb-c6b993051fe4","resolution":{"observed_at":"2026-08-12T15:42:59.246831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"cited_work":{"arxiv_id":"2411.14019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14019","snapshot_observed_at":"2026-08-12T15:42:59.404858Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","venue":"cs.LG","work_id":"9944123c-3a73-4ecf-890c-1448550831be","year":2024},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.250552Z"},"links":{"cited_paper":"/paper/2411.14019","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:9202dff5c5da1fc61a9cf89b4a422ffbb8841af5a2ab82299e0c4c10714cf98d","observation_id":"96c5fc6b-ea2c-407a-b573-4d9f66b394f2","resolution":{"observed_at":"2026-08-12T15:42:59.410682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T18:37:20.729761Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2411.14019."}