{"as_of":"2026-08-18T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74cc9f2c12bffa0da1499d73f5b45803a9fcc6cd320c8dcb25d5a538e2a30681","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:26:02.942258Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11052/citation-record","integrity":"/paper/2608.11052/integrity","json":"/paper/2608.11052/citation-record.json","paper":"/paper/2608.11052"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.539102Z","title":"Therefore, αDKL(epπθ ∥epϕ) =E τ∼epπθ \" ∞X t=1 (αlogπ θ(at |s t)−r ϕ(st, at)) # +αlogZ ϕ","venue":null,"work_id":"6246c8a1-3857-4be7-85ac-5742edc2b242","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.934443Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:198ca0b13dee07c1fddca6f46290bf4b2853e813213d50c43167b4cfbf6d0bf2","observation_id":"28a544c9-ce1c-46a3-9b4c-2e9a0bb31ec3","resolution":{"observed_at":"2026-08-12T11:26:03.543094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.525276Z","title":"∞X t=1 γt−1 logπ θ(at |s t) # =−E τ∼p expert","venue":null,"work_id":"c7857f95-6ada-47a4-82bd-8b46b947d005","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.938246Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:e5698c215b21a09b56dacfbc17259ad37e87007cdb42ccf29c96d49ae287d09f","observation_id":"8d26906d-e9d7-4351-9676-5ae542388b98","resolution":{"observed_at":"2026-08-12T11:26:03.530082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10905","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.312598Z","title":"Natural hypergradient de- scent: Algorithm design, convergence analysis, and parallel implementation.arXiv preprint arXiv:2602.10905,","venue":null,"work_id":"0e1578f5-8e35-44b2-96f6-6d12a8bd0a30","year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.906229Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:14b12d481e16494c8a35b995b0d136df84e07b5d6af6194ca91d845adb5864ad","observation_id":"99918331-970a-4806-b099-f850cac23993","resolution":{"observed_at":"2026-08-12T11:26:03.319693Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01820","last_updated":"2022-09-05T08:06:29Z","snapshot_observed_at":"2026-08-17T23:23:51.976914Z","submitted_at":"2022-09-05T08:06:29Z","title":"Natural Policy Gradients In Reinforcement Learning Explained","version":1},"cited_work":{"arxiv_id":"2209.01820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.01820","snapshot_observed_at":"2026-08-12T11:26:03.098617Z","title":"Natural Policy Gradients In Reinforcement Learning Explained","venue":"cs.LG","work_id":"4b23d006-9395-47a2-8b47-66d40c53bc0c","year":2022},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.918211Z"},"links":{"cited_paper":"/paper/2209.01820","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:78d8c1c3539f6377532802a064a6478b1eae25eb55fa803f71a9ae29f5fa0914","observation_id":"a6300e82-9013-4f85-b8f3-27690ad68883","resolution":{"observed_at":"2026-08-12T11:26:03.105051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.550459Z","title":"∂g ∂θ θ⋆(ϕ),ϕ #−1 ∂g ∂ϕ θ⋆(ϕ),ϕ . Since ∂g ∂θ = ∂2Linner ∂θ 2 , ∂g ∂ϕ = ∂2Linner ∂θ∂ϕ , we get dθ⋆ dϕ ϕ =−","venue":null,"work_id":"b6519dd6-fbe7-4ff3-99b9-c8a440a83d73","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.930040Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:d1429b272e27cda72d07bd223ffb486b94f85b1ad26f1c822aabacc80bd38fc9","observation_id":"a2d1dcd2-a8ef-4ae1-8586-5ac449da702a","resolution":{"observed_at":"2026-08-12T11:26:03.554667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.512482Z","title":"∞X t=1 gt(τ)g t(τ) ⊤ # . Finally, applying Lemma 4.1 componentwise gives Eτ∼epπθ","venue":null,"work_id":"6dfe6454-dd89-408b-9a54-b632c953b85b","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.942258Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:aacaf6988145d5844ac2eb89700a97e69f6cdabf6be8677009757f0cb4109bc4","observation_id":"835c4e51-022e-47ac-b652-c035985b099a","resolution":{"observed_at":"2026-08-12T11:26:03.516484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.70401","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.499191Z","title":"Souradip Chakraborty, Amrit Bedi, Alec Koppel, Huazheng Wang, Dinesh Manocha, Mengdi Wang, and Furong Huang","venue":null,"work_id":"68be8db3-d2a6-479d-bd96-345a7e2852f1","year":2014},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.885600Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:7f5aedbc0aaa38de8465c11d6651e343a59e40c240feb75d35fd8f14650aa5fb","observation_id":"77b36f46-a84c-4f6c-8c3f-4d103b32b54e","resolution":{"observed_at":"2026-08-12T11:26:03.505054Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18626","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.391062Z","title":"Rank-1 ap- proximation of inverse fisher for natural policy gradients in deep reinforcement learning.arXiv preprint arXiv:2601.18626,","venue":null,"work_id":"e8f00bd8-5c94-4799-8b9c-c6229aee4a75","year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.902323Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:d115a79a2db29327a8f407153309ecd028dc70ed2b7aa786bb6b9fcc3a648a99","observation_id":"c70af340-f658-41db-9ef7-2cf63e31a3b2","resolution":{"observed_at":"2026-08-12T11:26:03.397415Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19697","last_updated":"2025-02-27T06:52:19Z","snapshot_observed_at":"2026-08-16T13:47:55.533896Z","submitted_at":"2024-05-30T05:24:20Z","title":"Bilevel reinforcement learning via the development of hyper-gradient without lower-level convexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19697","snapshot_observed_at":"2026-08-12T11:26:02.922372Z","title":"Bilevel reinforcement learning via the development of hyper-gradient without lower-level convexity.arXiv preprint arXiv:2405.19697,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.922372Z"},"links":{"cited_paper":"/paper/2405.19697","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:9a8932f738a1356430731c96e6c8317c98e28a783a02e15c2bbbe30ef40e6d71","observation_id":"d5f7b85f-c790-4f6b-be2c-172610441a12","resolution":{"observed_at":"2026-08-12T11:26:02.922372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1501.01711","last_updated":"2015-04-21T16:17:01Z","snapshot_observed_at":"2026-08-14T23:04:52.026998Z","submitted_at":"2015-01-08T02:32:32Z","title":"Frequent Directions : Simple and Deterministic Matrix Sketching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1501.01711","snapshot_observed_at":"2026-08-12T11:26:02.897810Z","title":"Frequent directions: Simple and deterministic matrix sketching.arXiv preprint arXiv:1501.01711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.897810Z"},"links":{"cited_paper":"/paper/1501.01711","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:29c29b9036a355ab4f75699644c24e453a0eb2215a3dc34af717dc1e97c6938a","observation_id":"9f09e1a8-f956-4cb0-b6ec-e6f769f93771","resolution":{"observed_at":"2026-08-12T11:26:02.897810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-12T11:26:02.909932Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.909932Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:3fcb49875fd4adec8208f7931838d5fcfdff2a11f6288ccd73c325913061f4c0","observation_id":"53da9989-9480-4f50-bfb5-83c2cef374ac","resolution":{"observed_at":"2026-08-12T11:26:02.909932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04266","last_updated":"2026-05-05T20:01:36Z","snapshot_observed_at":"2026-08-01T01:52:21.623300Z","submitted_at":"2026-05-05T20:01:36Z","title":"Explaining and Preventing Alignment Collapse in Iterative RLHF","version":1},"cited_work":{"arxiv_id":"2605.04266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04266","snapshot_observed_at":"2026-08-12T11:26:03.433332Z","title":"Explaining and Preventing Alignment Collapse in Iterative RLHF","venue":"cs.LG","work_id":"f399b322-84ae-46e1-927e-47d65a0ad3e1","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.889788Z"},"links":{"cited_paper":"/paper/2605.04266","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:7e12d6696cb818343da5e8ca226d9366caa44d3f0b9bf0f4e9468b46ceeee8f6","observation_id":"444421fd-0641-4f09-ab05-109e196003cc","resolution":{"observed_at":"2026-08-12T11:26:03.437865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.562974Z","title":"Then the gradient of the induced outer objective eLouter(ϕ) :=L outer(θ⋆(ϕ)) is given by ∇ϕ eLouter ϕ =− ∂2Linner ∂ϕ∂θ θ⋆(ϕ),ϕ \" ∂2Linner ∂θ 2 θ⋆(ϕ),ϕ #−1 ∇θLouter|θ⋆(ϕ)","venue":null,"work_id":"90e07436-e6ef-47ec-ab1a-8f1ffa435a48","year":2026},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.926453Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:1ae14f537a3317a93f5d0513b7117ef2f96e76845720aa662f9ce7629b9f0ed5","observation_id":"239f0717-51cb-4e91-9462-21904e9e9e82","resolution":{"observed_at":"2026-08-12T11:26:03.568289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19349","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:26:03.208370Z","title":"Scalable linucb: Low-rank design matrix updates for recommenders with large action spaces.arXiv preprint arXiv:2510.19349,","venue":null,"work_id":"97d57fec-d801-46bb-8e05-5519e3c2db38","year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.914384Z"},"links":{"citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:73a767e7b4af079fa7d15def0b03456c71587b051e5fe4893dccfc0cf84a0f51","observation_id":"e58c82b5-d24e-49e6-9a5d-35eefb8e4fc7","resolution":{"observed_at":"2026-08-12T11:26:03.214880Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-08-16T15:51:37.195604Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-08-12T11:26:02.893846Z","title":"Approximation methods for bilevel programming.arXiv preprint arXiv:1802.02246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:02.893846Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2608.11052"},"observation_digest":"sha256:e2b6b64b6ddb9d2b20f0c2d2c8dcf7f6623a854900d3dc6b8fce3825fa3d9608","observation_id":"b77cffe1-f9a4-4743-bc39-6893c3c913f5","resolution":{"observed_at":"2026-08-12T11:26:02.893846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11052","last_updated":"2026-08-11T15:22:16Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T12:38:08.937168Z","submitted_at":"2026-08-11T15:22:16Z","title":"Efficient Hypergradient Descent for Inverse Reinforcement Learning"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":5,"verified_fuzzy":5},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2608.11052."}