{"as_of":"2026-08-17T17:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:241022ab1238adf943cce3e6945396e43624c3b80434b92e04a93cf6e6743b66","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:59:38.022401Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.15206/citation-record","integrity":"/paper/2602.15206/integrity","json":"/paper/2602.15206/citation-record.json","paper":"/paper/2602.15206"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:38.022401Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:38.022401Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:c69260202b34a6ee977df56fd2471f9a81fcb7d524ea6b01cb0edd4593948f09","observation_id":"c23f11f1-2fd9-4976-8cd6-1aa4647a3a10","resolution":{"observed_at":"2026-08-02T22:59:38.022401Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-02T22:59:37.082536Z","title":"MaÃG, l Macuglia, Paul Friedrich, and Giorgia Ramponi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.082536Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:b4c5b7ee15f7ec65c0a05c881cf3cc0ce9cf941fe8fa2f0547e91716e15d3294","observation_id":"dd1ee73f-9612-41ad-ac88-2d0b75328dbb","resolution":{"observed_at":"2026-08-02T22:59:37.082536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:37.379875Z","title":"URL https://doi.org/10.1145/3623384","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.379875Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:0943fb095c7c019e9f1a7ae385801210a49f3d4ede8d6b8de960e266770ddcc5","observation_id":"f846c9cd-60c5-40d8-9c43-cb51d9fb91f2","resolution":{"observed_at":"2026-08-02T22:59:37.379875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04332","last_updated":"2023-08-08T15:21:30Z","snapshot_observed_at":"2026-08-17T14:09:15.144726Z","submitted_at":"2023-08-08T15:21:30Z","title":"RLHF-Blender: A Configurable Interactive Interface for Learning from Diverse Human Feedback","version":1},"cited_work":{"arxiv_id":"2308.04332","doi":"10.48550/arxiv.2308.04332","metadata_source":"pith","pith_arxiv_id":"2308.04332","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"RLHF-Blender: A Configurable Interactive Interface for Learning from Diverse Human Feedback","venue":"cs.LG","work_id":"1d2a092b-16ed-47fa-abf3-8e1edba1edb0","year":2023},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.478147Z"},"links":{"cited_paper":"/paper/2308.04332","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:4ad8bb6fa046102ac63b022098219149445980b5c9fdbd12a21ff3beb577d6f3","observation_id":"268e2b95-fc1e-44cd-a3ed-ac98b11670dc","resolution":{"observed_at":"2026-08-02T23:04:09.648070Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:37.604747Z","title":"Vivek Myers, Erdem Bıyık, Nima Anari, and Dorsa Sadigh","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.604747Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:2babcc9ea75ee069e3fb9da59d9b36e5853a36e5dd1371eeaab9afde21584b8b","observation_id":"ecc515b6-c2dd-428d-85e2-c4b2f8ccd695","resolution":{"observed_at":"2026-08-02T22:59:37.604747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-02T22:59:37.730664Z","title":"arXiv:2203.02155 [cs]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.730664Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:17ff6f9b462bbf8acfa186d908aed0d7fd634be0b3c7f05b52b9382affcb9f13","observation_id":"35cae80d-7fd8-4431-8600-5ccbf5b974b7","resolution":{"observed_at":"2026-08-02T22:59:37.730664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-02T22:59:37.894011Z","title":"Sriyash Poddar, Yanming Wan, Hamish Ivison, Abhishek Gupta, and Natasha Jaques","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.894011Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:436e2bbb0ee042450b577c829d5eac87d7629018d339c024dfeca2beffa5cd00","observation_id":"01800d95-c7cd-43c8-8e6c-b74caafb3306","resolution":{"observed_at":"2026-08-02T22:59:37.894011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:37.960668Z","title":"13 A Implementation Details A.1 Model Architecture The reward encoder qθ and Q-value estimator Qϕ were implemented as two-layer MLPs with Leaky ReLU activations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.960668Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:2230349198833e4ad89da5a81bc0281e9f7c6396c111604f7e404e161ab31043","observation_id":"b2246660-9ab4-48c7-9e67-7fdeef9e3261","resolution":{"observed_at":"2026-08-02T22:59:37.960668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:37.216647Z","title":"Shaunak A","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":1980,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.216647Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:dfffe064fd6266478ba70656664db03dd8672472363e93bc90a6fe78c1eaac13","observation_id":"9c228a7f-f9e2-4010-9580-9aea33351a72","resolution":{"observed_at":"2026-08-02T22:59:37.216647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:35.977656Z","title":"ISBN 978-1-58113-838-2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:35.977656Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:017fc04490e8ee8396dd608ae1349b377eaaedd1ba59fd6ff28e9026f51c3bec","observation_id":"d06f97f8-0610-4967-b1b9-6aab1ab2e25b","resolution":{"observed_at":"2026-08-02T22:59:35.977656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:36.914817Z","title":"ISBN 978-1-60558-658-8","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.914817Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:0d68df092f0a0b572e66b39f5602733545d34bc9f80be52afdf8a73dd9060f4b","observation_id":"8244124f-9067-429d-b58d-6bfdd43df72a","resolution":{"observed_at":"2026-08-02T22:59:36.914817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-02T22:59:36.704749Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.704749Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:f96bf364d1c3196b45b82d6030a9aa6a9436558c78e04ee23dbe98519f789326","observation_id":"b57aefb9-b22b-45d8-a9d1-09c2763386ab","resolution":{"observed_at":"2026-08-02T22:59:36.704749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-02T22:59:36.474748Z","title":"Dan Hendrycks, Nicholas Carlini, John Schulman, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.474748Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:705233a930c7c8b67ea5ef398cc4c56ea743813c4da1330558539d282d96d493","observation_id":"e40ae02c-c435-419f-a524-3fa31e9516e3","resolution":{"observed_at":"2026-08-02T22:59:36.474748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04833","last_updated":"2020-12-11T17:56:03Z","snapshot_observed_at":"2026-08-17T12:33:33.258247Z","submitted_at":"2020-02-12T08:07:49Z","title":"Reward-rational (implicit) choice: A unifying formalism for reward learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04833","snapshot_observed_at":"2026-08-02T22:59:36.591876Z","title":"arXiv:2002.04833 [cs]","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.591876Z"},"links":{"cited_paper":"/paper/2002.04833","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:386b2f0759114727f14314672fe95d840f2f07adf1f330fa612962b1dc891ad0","observation_id":"61f29625-6a8f-4974-87b8-5875edba4c1e","resolution":{"observed_at":"2026-08-02T22:59:36.591876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12750","last_updated":"2021-10-18T22:53:49Z","snapshot_observed_at":"2026-08-16T17:53:55.267095Z","submitted_at":"2021-09-27T01:22:01Z","title":"Learning Multimodal Rewards from Rankings","version":2},"cited_work":{"arxiv_id":"2109.12750","doi":"10.48550/arxiv.2109.12750","metadata_source":"pith","pith_arxiv_id":"2109.12750","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Learning Multimodal Rewards from Rankings","venue":"cs.LG","work_id":"2a060e1a-cc55-4a02-88db-60b259b96f1e","year":2021},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:37.663150Z"},"links":{"cited_paper":"/paper/2109.12750","citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:05fbc11f11f0364c77ee72f828f85fa73c9aa4249f9881b54491d1c50c7f81bf","observation_id":"6b1e099b-a8b8-4ce1-870c-a28b782a31ad","resolution":{"observed_at":"2026-08-02T23:04:09.540088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:36.202256Z","title":"doi: 10.1177/02783649211041652","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.202256Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:4746fc3843d2f880d49a49b75680110c295224b91b8ca651e9d7778684a77974","observation_id":"c9328504-8c06-47f4-9c62-3db756a303e8","resolution":{"observed_at":"2026-08-02T22:59:36.202256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i5.25740","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1609/aaai.v37i5.25740","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"72099be1-4ec6-4918-a7f6-129fe45865dd","year":null},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.363241Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:c55f41fddff75985641f7d8f586157ca15bfde76fdc596111338cce14dc1c1a0","observation_id":"5eb5badb-d0db-496c-8459-160db2383dc8","resolution":{"observed_at":"2026-08-02T23:04:09.842539Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:36.074912Z","title":"Dario Amodei, Chris Olah, Jacob Steinhardt, Paul Christiano, John Schulman, and Dan Mané","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.074912Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:1e13b7dc1f29614d3cdc9352d6c1ae2369d28086ffe76701ed4c65b7c897f871","observation_id":"f93f15a9-5612-410e-a186-8e7972475d65","resolution":{"observed_at":"2026-08-02T22:59:36.074912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:59:36.291389Z","title":"Scalable Bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T22:59:36.291389Z"},"links":{"citing_paper":"/paper/2602.15206"},"observation_digest":"sha256:16d5e225ef40bf57fc1830c03bed43d0b4134236ad1ca00a91e267ebb1e6b75a","observation_id":"0b6b0a61-a1ed-4f96-ac42-0b337c3049d6","resolution":{"observed_at":"2026-08-02T22:59:36.291389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.15206","last_updated":"2026-06-19T10:51:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T22:59:34.197898Z","submitted_at":"2026-02-16T21:36:28Z","title":"MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2602.15206."}