{"as_of":"2026-08-11T03:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d54618a91ac8949eaa311a5676f374a18915ace2bcb04c6343127b3eb0b83ee8","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:10:48.724636Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:27:25.150807Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:50:59.092753Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"cited_work":{"arxiv_id":"2501.14513","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14513","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abpt: Amended backpropagation through time with partially differentiable rewards","venue":null,"work_id":"dab9b009-b717-4677-86f3-1cbd22f7298a","year":2025},"citing_paper":{"arxiv_id":"2604.10548","last_updated":"2026-04-16T03:00:59Z","snapshot_observed_at":"2026-08-11T02:21:22.687892Z","submitted_at":"2026-04-12T09:38:00Z","title":"Simple but Stable, Fast and Safe: Achieve End-to-end Control by High-Fidelity Differentiable Simulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:25.150807Z"},"links":{"cited_paper":"/paper/2501.14513","citing_paper":"/paper/2604.10548"},"observation_digest":"sha256:caa1edd232650a21fa0ec30cae75e2bc6140cde05fe180d23637b6fffbbe4f56","observation_id":"9b8e006d-5641-4025-aac8-5e7acac6e7c9","resolution":{"observed_at":"2026-05-11T08:50:59.094277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.14513/citation-record","integrity":"/paper/2501.14513/integrity","json":"/paper/2501.14513/citation-record.json","paper":"/paper/2501.14513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.349516Z","title":"Loquercio, E","venue":null,"work_id":"bb418c2c-0cec-4ca8-b378-3d15e313c725","year":2021},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.602656Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:9fd28e31151965e9c29fb943864b5e44283b8e13cd329e33fa6b537134e9a58b","observation_id":"2a6c13df-86bb-4ab5-844b-fa927d35105c","resolution":{"observed_at":"2026-08-10T15:10:49.353788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.339707Z","title":"Loquercio, E","venue":null,"work_id":"9a0c4f58-1dfd-4688-833e-1b278c75f5ac","year":2019},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.606745Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:5c1b638b34d0cdbe6a2096dab880433e6df5949eb4a560c6e128cc42b96f7316","observation_id":"f39976c4-480f-430e-901b-7313d4e1f02f","resolution":{"observed_at":"2026-08-10T15:10:49.342872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.328448Z","title":"Kaufmann, A","venue":null,"work_id":"081f97d5-4f53-4ed0-9a70-cc7c9a9284a4","year":2018},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.609915Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:a37d4963099cd85c6f63e21648dbe21fafd660b8d3e7e2d52720586168042405","observation_id":"45562607-49e2-4e8c-84af-fb7895d5b67d","resolution":{"observed_at":"2026-08-10T15:10:49.333036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.317960Z","title":null,"venue":null,"work_id":"551a912c-09ea-44de-b3f8-2e8a924f29b4","year":2018},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.613006Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:be0bfb84fb744581ae2ceabbdb05a3cc7f839fef5e8a33bd948f53fe0c5e08be","observation_id":"76dcdfca-35c2-4c1d-9b97-52e3174b8cc8","resolution":{"observed_at":"2026-08-10T15:10:49.321381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10648","last_updated":"2024-07-16T03:41:08Z","snapshot_observed_at":"2026-08-10T13:45:12.893448Z","submitted_at":"2024-07-15T12:08:53Z","title":"Back to Newton's Laws: Learning Vision-based Agile Flight via Differentiable Physics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10648","snapshot_observed_at":"2026-08-10T15:10:48.616444Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.616444Z"},"links":{"cited_paper":"/paper/2407.10648","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:8b66be72c38e6736d03fa27daf6f7742dd463d7a4a5d2db9536b4e6182c862af","observation_id":"347fb54a-7ece-4caa-bd65-994b173fdad7","resolution":{"observed_at":"2026-08-10T15:10:48.616444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.620025Z","title":"Wiedemann, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.620025Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:148e6dd193448a3411ab0754f5467fe7594ec2dde8d6d686e31d617531d3e5ba","observation_id":"d4b199b2-798a-4c38-a549-84db8edd5f78","resolution":{"observed_at":"2026-08-10T15:10:48.620025Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.308062Z","title":null,"venue":null,"work_id":"ad502a09-9fb9-4acd-824e-256276f64180","year":2023},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.623414Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:9a1539154b18a10d9375251ea8795a9da0871c3a0b7e2a35e3d372a9f571d56b","observation_id":"cff916ca-fe64-46f4-8017-e934760916cf","resolution":{"observed_at":"2026-08-10T15:10:49.311453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14864","last_updated":"2024-10-15T13:30:26Z","snapshot_observed_at":"2026-08-10T17:58:24.664541Z","submitted_at":"2024-03-21T22:18:59Z","title":"Learning Quadruped Locomotion Using Differentiable Simulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14864","snapshot_observed_at":"2026-08-10T15:10:48.626404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.626404Z"},"links":{"cited_paper":"/paper/2403.14864","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:f35a17ac9ac30d44b83393cc7eb5c4a319a5fd05ab090e69205daf4cc7029b4a","observation_id":"8f7c4c75-7273-4fe9-a73d-23ee9732b71f","resolution":{"observed_at":"2026-08-10T15:10:48.626404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.629534Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.629534Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:af495fba1740625808c4b9a93a928d0c6285f037b5b6323887f806e90300841a","observation_id":"a3ed2d12-91a8-4c4a-b677-4296a8ba90f9","resolution":{"observed_at":"2026-08-10T15:10:48.629534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.299331Z","title":"Zhang, W","venue":null,"work_id":"29729f25-5536-42a0-88eb-d639d02a2c9f","year":2023},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.632272Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:03b27105c1005650dddad86ee0ecce909098b214ef5463e73056d3dd2bfc45d6","observation_id":"7add1830-6e13-4a1a-83ea-629e8f04fa1c","resolution":{"observed_at":"2026-08-10T15:10:49.301955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.290224Z","title":null,"venue":null,"work_id":"5e94b2f3-2a40-420f-848e-b1d126d74361","year":2022},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.635581Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:5d1885e7f60901e0c1f14798daf2a0a8edde4a5eb5eab54a9e33899ff77e1b3c","observation_id":"400c41c8-6704-48e0-a6bd-249558b1be33","resolution":{"observed_at":"2026-08-10T15:10:49.293561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-10T15:10:48.638379Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.638379Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:84b94f3da35d9a4e1b9b989a23597aa1561da808aeb08390b104ce05ca07c12f","observation_id":"fd32f32e-a259-4cee-a19a-26e41e0e3e02","resolution":{"observed_at":"2026-08-10T15:10:48.638379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-10T15:10:48.641907Z","title":"Lillicrap","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.641907Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:e538e0c68001c000712c3c5de74870607bfe8ea8d1c28ed758d3f2bbe1fdcc37","observation_id":"7541952c-6c51-45bb-bd5c-422ab98394e1","resolution":{"observed_at":"2026-08-10T15:10:48.641907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.280635Z","title":"Fujimoto, H","venue":null,"work_id":"17f2e3c1-219d-4dba-877a-5561733aa0dd","year":2018},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.645239Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:76b8263e92cacde5e52c23542bcef8f1044c8e0ebfa810fb4bb67f1dffbde5e6","observation_id":"17aeecff-0047-4d6d-8480-85f28b681b0a","resolution":{"observed_at":"2026-08-10T15:10:49.284169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.648213Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.648213Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:56afaf147846f92ba5bf938ac01d25f06c5c0e7e632b848655181dbaf4c1d6b2","observation_id":"4a649408-30d0-4204-af3c-9a67ed14f5ab","resolution":{"observed_at":"2026-08-10T15:10:48.648213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-10T15:10:48.651760Z","title":"Schulman","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.651760Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:8211d48ae578ce655291f251a09fcdeb17343e36723b173f206a0077fdd7dd21","observation_id":"7a4a7514-f73b-4c86-aac7-ed59c30b87bb","resolution":{"observed_at":"2026-08-10T15:10:48.651760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T15:10:48.655628Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.655628Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:cfaf0279bc6a3dd5a25a3f529690abfe715fca1370fca09a4f6a297863d3e94b","observation_id":"19e6577e-580f-4d35-b307-cbe404a74168","resolution":{"observed_at":"2026-08-10T15:10:48.655628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.264981Z","title":null,"venue":null,"work_id":"d1ec7ace-1a0a-48b2-b2cb-c7ba6204dc14","year":2023},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.659274Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:ab535a0f17f1c8749c157e17c438c7eeea01881c2bc2b04ef1c1d9419ad10dad","observation_id":"3282080b-e644-4e22-ae24-a23756b66830","resolution":{"observed_at":"2026-08-10T15:10:49.268170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.663178Z","title":"Deisenroth and C","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.663178Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:43e6b4c50cbeb71ed1be708dc53380433b2d8ad086cf656989a856d6e72e78e2","observation_id":"33b0d98d-fbac-4889-8b3d-984f6a4777a7","resolution":{"observed_at":"2026-08-10T15:10:48.663178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.248389Z","title":null,"venue":null,"work_id":"af39f30a-25de-4c95-ae86-a01837093a13","year":1990},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.666518Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:bd3251208489c3d5f297edfa921214459193c89389476bf6cacc3a125e896dd2","observation_id":"89d80766-acd2-4fc4-ab74-39af80008f1c","resolution":{"observed_at":"2026-08-10T15:10:49.251386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.669930Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.669930Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:c0e8ac2ffd718ba035f28415b3d41c90050db59e79d0505570a77b669b39a4ec","observation_id":"f128fc34-672c-413b-9455-c0091379df41","resolution":{"observed_at":"2026-08-10T15:10:48.669930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.673338Z","title":"Watter, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.673338Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:e7d1ac7d5068a492067c9759b4b18a71762e4a6e0e2eb74e853588eeaf296a33","observation_id":"f80059c9-6d7c-4d3c-90b7-61df54726a2c","resolution":{"observed_at":"2026-08-10T15:10:48.673338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-10T15:10:48.676127Z","title":"Hafner, T","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.676127Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:2ba530c4444d0fdf64cad10465cce86528bc19bc13454dd7fa4757c1b99dbe9e","observation_id":"44269d92-9f4d-49a8-a6a7-8fa60d2121d6","resolution":{"observed_at":"2026-08-10T15:10:48.676127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00935","last_updated":"2020-02-14T06:21:07Z","snapshot_observed_at":"2026-08-10T19:25:02.021953Z","submitted_at":"2019-10-01T05:00:26Z","title":"DiffTaichi: Differentiable Programming for Physical Simulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00935","snapshot_observed_at":"2026-08-10T15:10:48.679345Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.679345Z"},"links":{"cited_paper":"/paper/1910.00935","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:68bbe89dac8921e59bd5c9d19c2be72280a0f4850d75f1e9bf647a60eb0f3b19","observation_id":"16ba7ee5-3adb-4f6a-b810-88682f641455","resolution":{"observed_at":"2026-08-10T15:10:48.679345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13281","last_updated":"2021-06-24T19:09:12Z","snapshot_observed_at":"2026-07-06T11:22:55.799017Z","submitted_at":"2021-06-24T19:09:12Z","title":"Brax -- A Differentiable Physics Engine for Large Scale Rigid Body Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13281","snapshot_observed_at":"2026-08-10T15:10:48.682411Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.682411Z"},"links":{"cited_paper":"/paper/2106.13281","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:da690ef7aa492cfa3d96cbf51a0ce36a5de465dbeb6f4b0d21b1311ea76bd80c","observation_id":"b24d34d9-1fe3-423f-88c8-e060a774792c","resolution":{"observed_at":"2026-08-10T15:10:48.682411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.685299Z","title":"Todorov, T","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.685299Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:e2583b6a43f882bb239fea7f8943db2e24845c908ca06e98884e6d3379581180","observation_id":"b65633a5-3bf1-4189-95f9-b7995508fb8d","resolution":{"observed_at":"2026-08-10T15:10:48.685299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.95609","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.847194Z","title":"Heiden, D","venue":null,"work_id":"809fc9ea-4d10-403a-b6e4-647038b1127e","year":2021},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.688100Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:779686c13346c3ba3c3033b34bfded129abb8e180662d9a936a4d47bd2fed91c","observation_id":"d9036fca-56ba-4228-bf6a-1147d597a461","resolution":{"observed_at":"2026-08-10T15:10:48.855662Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00806","last_updated":"2025-08-26T17:27:30Z","snapshot_observed_at":"2026-07-06T12:43:02.968556Z","submitted_at":"2022-03-02T00:56:23Z","title":"Dojo: A Differentiable Physics Engine for Robotics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00806","snapshot_observed_at":"2026-08-10T15:10:48.690868Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.690868Z"},"links":{"cited_paper":"/paper/2203.00806","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:2cb85e283957e67a0055aec9db90a9ed9f6f5a726c27535ec4a66a6691708004","observation_id":"fe272e94-86ba-45a1-8198-9a65ea4d0140","resolution":{"observed_at":"2026-08-10T15:10:48.690868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14783","last_updated":"2024-09-09T11:28:22Z","snapshot_observed_at":"2026-07-06T18:49:25.288816Z","submitted_at":"2024-07-20T07:12:20Z","title":"VisFly: An Efficient and Versatile Simulator for Training Vision-based Flight","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14783","snapshot_observed_at":"2026-08-10T15:10:48.694231Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.694231Z"},"links":{"cited_paper":"/paper/2407.14783","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:4e4b9ce7219e35345b5e7d07ae288ee4a15130039336fd43324fd763bb4fd88f","observation_id":"b5ac3004-5f7c-4700-8691-2ef5ae39098e","resolution":{"observed_at":"2026-08-10T15:10:48.694231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.227457Z","title":"Savva, A","venue":null,"work_id":"0eb80f6a-6e0c-4293-8033-0ca59a851a17","year":2019},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.697111Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:f02b30370b9d4cc5a1e996207bc31ce72fb7d5c5e9a27607a0ab1432ab6e537c","observation_id":"c9b09ff2-12dc-452b-874c-933a5043cb92","resolution":{"observed_at":"2026-08-10T15:10:49.230830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.217481Z","title":"Schoenholz and E","venue":null,"work_id":"151142aa-fbd3-43e2-b100-9205277a55ce","year":2020},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.699836Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:50d25531b4ed7d46a16cc465f6d791a5323a1195fb99c9567b22a7815ac9ecac","observation_id":"bd1987eb-84d1-454c-915c-ba001b222dad","resolution":{"observed_at":"2026-08-10T15:10:49.220966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.702421Z","title":"Paszke, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.702421Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:1d471d11210ad8141789e2895cf53425fa9170983acf40a116be61e5b6873e91","observation_id":"55011a73-a570-4ff0-a2b4-089610a5fbee","resolution":{"observed_at":"2026-08-10T15:10:48.702421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.201099Z","title":null,"venue":null,"work_id":"6e1e47bb-44e3-43a0-af8a-2ae9462c767a","year":2013},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.705121Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:3fa284e444fab4d1dd0194dedc3fdf3f90d96e406b57564873fe23e1c825b3c4","observation_id":"7239ef10-55ae-4a66-8fbe-5d8e30adfe93","resolution":{"observed_at":"2026-08-10T15:10:49.204429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.190792Z","title":null,"venue":null,"work_id":"74fdfe2a-cea0-4dcf-91a5-2f85b5859a25","year":2021},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.707788Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:8e076028a7fa884dd4c622e76c0cde5dc8f222da502ce4e43f32f78042159b88","observation_id":"f66c94d8-eb33-4d30-81ea-cca8aa979c40","resolution":{"observed_at":"2026-08-10T15:10:49.194264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07137","last_updated":"2022-04-14T17:46:26Z","snapshot_observed_at":"2026-07-06T13:00:30.959591Z","submitted_at":"2022-04-14T17:46:26Z","title":"Accelerated Policy Learning with Parallel Differentiable Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07137","snapshot_observed_at":"2026-08-10T15:10:48.710302Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.710302Z"},"links":{"cited_paper":"/paper/2204.07137","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:2352f2a3eb8a334858fce35a3fdd4069e018ebb8cc0d359b32ae67fcaaeadc71","observation_id":"7c01b7eb-38dc-4cb7-a07d-ee093e2e55d1","resolution":{"observed_at":"2026-08-10T15:10:48.710302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.180784Z","title":null,"venue":null,"work_id":"fe39159c-a298-42a1-bc6f-396d6e20905f","year":2024},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.713293Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:541250cc090cd3b5b61961839f7d5d9c63227d7f2d530c410e8e0a1b936d344f","observation_id":"35d460f6-6cb4-440d-b663-31922bd13f68","resolution":{"observed_at":"2026-08-10T15:10:49.184123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.170224Z","title":null,"venue":null,"work_id":"831081ba-092a-45b3-8301-d68d936c2aee","year":2013},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.716317Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:871809149720cee6f939ae5e853f4d9fb8cff88c0e1c6101ba96a2fb9b71d797","observation_id":"914e794d-130e-4aae-8efb-3407f3df2b52","resolution":{"observed_at":"2026-08-10T15:10:49.173553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:48.719001Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.719001Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:28a9252ebbbe2b73d2bfff36a6ff6a22f2116048848facf7ca74ef3a00fdee18","observation_id":"64f414f3-b693-4cc7-8005-2d0709843394","resolution":{"observed_at":"2026-08-10T15:10:48.719001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-10T15:10:48.721707Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.721707Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:1fbe61f0444211dfa48eda9d003a59c78243cf958f837658e40c6e2781266d2e","observation_id":"f144207a-ff4e-4f5d-99db-4c575ce70b95","resolution":{"observed_at":"2026-08-10T15:10:48.721707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:49.154022Z","title":"Raffin, A","venue":null,"work_id":"fdfb478b-f852-4baa-abff-d648134979e3","year":2021},"citing_paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:48.724636Z"},"links":{"citing_paper":"/paper/2501.14513"},"observation_digest":"sha256:f0a635210a4f6838f0c9abdc4589e6e48a72e043681d3b34d1fd10a58c48eacc","observation_id":"92b81cd6-9db5-4b6b-acce-458de32401a5","resolution":{"observed_at":"2026-08-10T15:10:49.157346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.14513","last_updated":"2025-05-21T11:27:06Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-11T00:47:32.188081Z","submitted_at":"2025-01-24T14:18:22Z","title":"ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2501.14513."}