{"as_of":"2026-08-08T01:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0bfcbf47c0b898356961c73dc0894426dbb6704d15f56827e53802732836f294","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:13:01.213190Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00388/citation-record","integrity":"/paper/2506.00388/integrity","json":"/paper/2506.00388/citation-record.json","paper":"/paper/2506.00388"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.074379Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.074379Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:adc2a8804081fc5abc67f5b79221e573e245d0fcb6404c880c3ad68f778f5850","observation_id":"250a93c1-e861-440f-b914-2164a8bd24a1","resolution":{"observed_at":"2026-08-07T12:12:57.074379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.500268Z","title":"G., Candido, S., Castro, P","venue":null,"work_id":"b3a772b8-47d2-42dd-a913-c12d8d4df6cc","year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.147263Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:cf2505a07fc3dcd7107f148a26a32b423a965d13ad3a82e20c9aa357dc950335","observation_id":"54d7213e-edb2-437b-95bc-fa5e10e26b29","resolution":{"observed_at":"2026-08-07T12:13:03.592044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.336400Z","title":"Learning to distinguish: shared perceptual features and discrimination practice tune behavioural pattern separation","venue":null,"work_id":"a5a2fe1f-a4c6-4a19-a490-39749dde10a5","year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.238918Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:ff3419db415d0dc1e38cfb241e877beaf294844903b5ef1c0abfbca4370a2d47","observation_id":"e04203ac-c923-4752-a3f6-a23e54f4bb58","resolution":{"observed_at":"2026-08-07T12:13:03.418448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.158833Z","title":"Active preference-based gaussian process regression for reward learning","venue":null,"work_id":"f50812e1-dbc8-42dd-ab7b-1c8198744b12","year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.330118Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:543f7a0751349b6f1a216044cbd17ff0f9370ec0ab0d29fa0056c9c3a8fb585f","observation_id":"1a505b6a-ca0d-44e2-aba9-e49c090cce6d","resolution":{"observed_at":"2026-08-07T12:13:03.268428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.354573Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.354573Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:f319be1d741ea0553d4caca0db5a17ce582569755e9f3059ab227c69a289f011","observation_id":"e479e1df-6574-48d8-a2e8-b097915e16e3","resolution":{"observed_at":"2026-08-07T12:12:57.354573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.439208Z","title":"and He, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.439208Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:a2c8fc04c62c3cc8359b97903b28df0b6120b9fc2c6989e6b733b400f80da04d","observation_id":"1bd4b567-0992-476d-aa06-2b0964c20d66","resolution":{"observed_at":"2026-08-07T12:12:57.439208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17257","last_updated":"2024-10-28T12:26:53Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T07:03:25Z","title":"RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17257","snapshot_observed_at":"2026-08-07T12:12:57.502734Z","title":"Rime: Robust preference-based reinforcement learning with noisy preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.502734Z"},"links":{"cited_paper":"/paper/2402.17257","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:8601ea974c19acc0ff8141860935d49ab3e63f08b2539aa4f59dc27c53ccfd63","observation_id":"d7ec4a76-b6b0-47f6-ae4f-ccec4cdd5be6","resolution":{"observed_at":"2026-08-07T12:12:57.502734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04190","last_updated":"2024-08-08T03:18:42Z","snapshot_observed_at":"2026-08-04T22:38:17.926793Z","submitted_at":"2024-08-08T03:18:42Z","title":"Listwise Reward Estimation for Offline Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2408.04190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04190","snapshot_observed_at":"2026-08-07T12:13:01.656376Z","title":"Listwise Reward Estimation for Offline Preference-based Reinforcement Learning","venue":"cs.LG","work_id":"ccfe2d4c-d4ff-4e0f-ad7b-2724526bc851","year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.547010Z"},"links":{"cited_paper":"/paper/2408.04190","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:550620ce8ca85f21fcce413df416ad7ecad2b384238ac9aa3505e2adbcdd1583","observation_id":"c9248b55-c092-436d-9845-69455364ba71","resolution":{"observed_at":"2026-08-07T12:13:01.753321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.626849Z","title":"Learning a similarity metric discriminatively, with application to face verification","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.626849Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:ae4a2fce8119bf33b544d68132decc66828f45fdfb575516ed9d1e04f0cecc8f","observation_id":"89a3358b-236d-486f-80f2-80e68e37d0a8","resolution":{"observed_at":"2026-08-07T12:12:57.626849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.702927Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.702927Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:7c56db244688a9b609452c95c445d1d307fb847f013370b1f25d90ae333717aa","observation_id":"43919007-ec05-4297-9da6-36c5f86c37bd","resolution":{"observed_at":"2026-08-07T12:12:57.702927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T12:12:57.766405Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.766405Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:1a49264dd0975acfebde97fc50de85b552d8a56aedc809ee9cc5fd2d31664217","observation_id":"1a34d678-3436-4a3a-a4fe-65d1b7b3e432","resolution":{"observed_at":"2026-08-07T12:12:57.766405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-07-06T12:10:16.997623Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-07T12:12:57.859163Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.859163Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:eff4fa16f22c8d5f74918eb318d59d652ae2ba6459fd7d36043bfc7be02c7473","observation_id":"abc8b36e-fc44-4deb-ad0b-d09b727f5b1d","resolution":{"observed_at":"2026-08-07T12:12:57.859163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.933451Z","title":null,"venue":null,"work_id":"065eac30-d211-48d8-9b5d-de3f230490ba","year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.997015Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:dc0a3edf8fac98369801e81c5a5772475c8b1518bf8786a8c4df38d218ad10a9","observation_id":"b45fc730-8cc9-4621-9f44-ee2ae67fa062","resolution":{"observed_at":"2026-08-07T12:13:03.000325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04451","last_updated":"2024-07-05T12:05:37Z","snapshot_observed_at":"2026-07-06T18:41:57.207738Z","submitted_at":"2024-07-05T12:05:37Z","title":"Hindsight Preference Learning for Offline Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04451","snapshot_observed_at":"2026-08-07T12:12:58.048180Z","title":"Hindsight preference learning for offline preference-based reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.048180Z"},"links":{"cited_paper":"/paper/2407.04451","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:a127398540a708b058710db9eda98a105377ecbcd06153804dc28da8b174315e","observation_id":"1179e094-1d9b-4423-bdc4-75bde49d1d28","resolution":{"observed_at":"2026-08-07T12:12:58.048180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.704351Z","title":"and Sadigh, D","venue":null,"work_id":"b4b44657-641d-4366-bb0d-85af6840d1f6","year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.112002Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:a336558bd6e0d95fe48bdd3efb7690cff5267b8cecb221063bacb6a0fa800b93","observation_id":"b71a3d6c-8600-487c-8108-c3687755c31a","resolution":{"observed_at":"2026-08-07T12:13:02.802723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:58.174843Z","title":"Reward learning from human preferences and demonstrations in atari","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.174843Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:973585786549dd298180df68b9bde363780dfaadb7e9fa0b3e75c6aca854279b","observation_id":"144323eb-6a86-404c-afb8-5cdfbfdcd49f","resolution":{"observed_at":"2026-08-07T12:12:58.174843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.408948Z","title":"Tuning in to how neurons distinguish between stimuli","venue":null,"work_id":"bd561586-239e-49e9-acd5-26862cf2fb82","year":2006},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.256962Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:4751ba828a3d141d0f8a0a45166b1465d517919d8db8a67307b72eda03ccd4e8","observation_id":"0378777a-f6aa-451c-8e86-d440816a9297","resolution":{"observed_at":"2026-08-07T12:13:02.486917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.249401Z","title":"Episodic novelty through temporal distance","venue":null,"work_id":"0688539d-9845-4ac5-b689-ecc0a32471c2","year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.309735Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:bbc05869238a1730fcf0abcb48f481c83d0a6f61e29e1d4f53e77ce93d2a64f6","observation_id":"99d4ff69-fea4-443c-83dc-edd97301a97c","resolution":{"observed_at":"2026-08-07T12:13:02.287093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.118660Z","title":"Transferring policy of deep reinforcement learning from simulation to reality for robotics","venue":null,"work_id":"937c58a7-016c-4ed7-8f57-08c003cc0fe2","year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.354488Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:62255d83cc42e8cfa4c487c114abe1611466148b954dc92d7d0c06a7148e31e1","observation_id":"769b3f9d-210d-4324-9761-b8f37d1b5367","resolution":{"observed_at":"2026-08-07T12:13:02.157844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:58.463092Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.463092Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:46964287e2c5319c1d5fddc870d9f0bf878d6e1a9cea4146c9e5b6be526fb914","observation_id":"e33ead37-5bc7-4215-84bf-5ac5a8506a86","resolution":{"observed_at":"2026-08-07T12:12:58.463092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16217","last_updated":"2023-06-09T07:48:49Z","snapshot_observed_at":"2026-08-03T21:59:17.886008Z","submitted_at":"2023-05-25T16:24:11Z","title":"Beyond Reward: Offline Preference-guided Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16217","snapshot_observed_at":"2026-08-07T12:12:58.566244Z","title":"Beyond reward: Offline preference-guided policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.566244Z"},"links":{"cited_paper":"/paper/2305.16217","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:7a1f5e93afc3632f9300130d8c9b1156343f572cd62cabc47b1ccee92bc59a6e","observation_id":"39893ad9-687e-45ad-949f-f43fe432dbf1","resolution":{"observed_at":"2026-08-07T12:12:58.566244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.035698Z","title":"Preference transformer: Modeling human preferences using transformers for rl","venue":null,"work_id":"a3ce1b70-1f92-44e7-bd87-76e811dde55c","year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.705934Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:f88d02e5bd86858ca022816ce7b5a7742a9fe1c0985caa9cbd8e328f563571d7","observation_id":"f1aa0140-78bb-4265-974a-256780365eb6","resolution":{"observed_at":"2026-08-07T12:13:02.066230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T12:12:58.782816Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.782816Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:6a8b17b3010171faaeda3cc2cffde5b9fd4c9fbdefce44ef278b49f6b6650e62","observation_id":"573e15d2-3710-4a67-9edd-851b0dc63bef","resolution":{"observed_at":"2026-08-07T12:12:58.782816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:58.924071Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.924071Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:a8cd9d701de764df7579a2a120102e4c84d0e4ff465ae3219773de19ebce3b67","observation_id":"90389d52-fd13-4079-84f8-66984933191a","resolution":{"observed_at":"2026-08-07T12:12:58.924071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-03T18:30:16.023253Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-07T12:12:59.030007Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.030007Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:03abee6c2b43971b5690a319a3758abcb9c36bd8ee17bb8bddaa2642651c4d96","observation_id":"8190da58-22ab-43de-a3f7-162654f53e83","resolution":{"observed_at":"2026-08-07T12:12:59.030007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-07T12:12:59.151835Z","title":"B-pref: Benchmarking preference-based reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.151835Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:bf7f7cfb6bcc851e16c69030b91aaa1875d5ea0be0e69d37c72a5e579dd95a0b","observation_id":"6c8e3ae6-9185-403b-869a-96c023284f05","resolution":{"observed_at":"2026-08-07T12:12:59.151835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.894058Z","title":"Survival instinct in offline reinforcement learning","venue":null,"work_id":"b61b368e-dfb8-4e69-be3c-3b2c732c211a","year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.288060Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:9c0839da233bfb0cc18e7f4d65839aa6058cd4233fbb589d6dbecb03decd70bf","observation_id":"f3ab3b8f-f2e9-4a75-93fe-7b11dd15946e","resolution":{"observed_at":"2026-08-07T12:13:01.970434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12401","last_updated":"2022-05-24T23:22:10Z","snapshot_observed_at":"2026-08-04T02:19:10.653516Z","submitted_at":"2022-05-24T23:22:10Z","title":"Reward Uncertainty for Exploration in Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12401","snapshot_observed_at":"2026-08-07T12:12:59.440374Z","title":"Reward uncertainty for exploration in preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.440374Z"},"links":{"cited_paper":"/paper/2205.12401","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:2605f0227436903adcab1ab4f0b290e556405e608df4a64a44fadf89b652c4d3","observation_id":"1387e94c-3fdf-408f-b021-b70d45fbb5b9","resolution":{"observed_at":"2026-08-07T12:12:59.440374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:59.633355Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.633355Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:3096c6e409677e8634a56cf23df42ca2806a37d6fe108757b7963a1a504356bc","observation_id":"8e0ac5bf-e130-47d6-adab-5a92f2968f88","resolution":{"observed_at":"2026-08-07T12:12:59.633355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12130","last_updated":"2025-05-13T14:30:16Z","snapshot_observed_at":"2026-07-06T19:04:22.495890Z","submitted_at":"2024-08-22T04:54:25Z","title":"S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12130","snapshot_observed_at":"2026-08-07T12:12:59.815667Z","title":"S-epoa: Overcoming the indistinguishability of segments with skill-driven preference-based reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.815667Z"},"links":{"cited_paper":"/paper/2408.12130","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:6e46fba2da97cef9a34f22b3b81701af6603f796a20c623d7405b5fccde9665a","observation_id":"f89b50c1-8f96-4fc7-b1c9-87a7b865bfcf","resolution":{"observed_at":"2026-08-07T12:12:59.815667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17098","last_updated":"2025-03-10T07:33:32Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T19:36:45Z","title":"Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17098","snapshot_observed_at":"2026-08-07T12:12:59.969023Z","title":"Learning temporal distances: Contrastive successor features can provide a metric structure for decision-making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.969023Z"},"links":{"cited_paper":"/paper/2406.17098","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:86d42c12b773d2357ece30adab104f217c5daf34bd25fe2dc6430698308c66d3","observation_id":"faf88960-dd49-4059-a571-3472806c415b","resolution":{"observed_at":"2026-08-07T12:12:59.969023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T12:13:00.091060Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.091060Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:e300ad8ebbddea32c5ba22914f821458fb79f528201095118512649a8fe02238","observation_id":"c95aa10b-79be-4370-a553-f3c490942db1","resolution":{"observed_at":"2026-08-07T12:13:00.091060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:00.201111Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.201111Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:8706f62e935206317f78df7842be8b7216bebcbef5b106ea52df9a0b4dade079","observation_id":"4c46c2c8-2b1f-4eb0-a9a4-b39f94a9886a","resolution":{"observed_at":"2026-08-07T12:13:00.201111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10050","last_updated":"2022-03-18T16:50:38Z","snapshot_observed_at":"2026-07-06T12:49:40.338344Z","submitted_at":"2022-03-18T16:50:38Z","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10050","snapshot_observed_at":"2026-08-07T12:13:00.332041Z","title":"Surf: Semi-supervised reward learning with data augmentation for feedback-efficient preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.332041Z"},"links":{"cited_paper":"/paper/2203.10050","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:195c28e3a9f5e28fc28051b7165ef615c884bef1e0ba5d21c77e3bab442992dd","observation_id":"cba3728a-2163-4aaa-8eee-1e95afce2404","resolution":{"observed_at":"2026-08-07T12:13:00.332041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-07T12:13:00.476431Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.476431Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:027d6097935429bb6c2440190495635f42d7ef9a4661f32ce4b77358d5725a33","observation_id":"2d234ffd-ef7e-4178-98fd-518cc1164d1e","resolution":{"observed_at":"2026-08-07T12:13:00.476431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.01392","last_updated":"2023-01-03T23:52:16Z","snapshot_observed_at":"2026-07-06T14:37:16.907677Z","submitted_at":"2023-01-03T23:52:16Z","title":"Benchmarks and Algorithms for Offline Preference-Based Reward Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.01392","snapshot_observed_at":"2026-08-07T12:13:00.672841Z","title":"D., and Brown, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.672841Z"},"links":{"cited_paper":"/paper/2301.01392","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:308ec1e7400a75d9453a1c317f22febfa58f6095dd98327eadfb1f547e6af482","observation_id":"3931ac7b-a868-4eec-9af1-bf714c641b6c","resolution":{"observed_at":"2026-08-07T12:13:00.672841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:13:00.774609Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.774609Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:9f6f9910161749450d312215d861d1e66df4b1ca880d53146c04d7638f62be7e","observation_id":"17e588d6-466d-4205-938a-469714d91c97","resolution":{"observed_at":"2026-08-07T12:13:00.774609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11774","last_updated":"2024-05-08T15:58:02Z","snapshot_observed_at":"2026-07-06T14:45:19.481734Z","submitted_at":"2023-01-27T15:18:54Z","title":"Reinforcement Learning from Diverse Human Preferences","version":3},"cited_work":{"arxiv_id":"2301.11774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.11774","snapshot_observed_at":"2026-08-07T12:13:01.313466Z","title":"Reinforcement Learning from Diverse Human Preferences","venue":"cs.LG","work_id":"dc209747-9f86-444c-8789-0655b8d8bfe5","year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.884525Z"},"links":{"cited_paper":"/paper/2301.11774","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:df6eec15219041c896191ad36e84a3c53360bc0cf37c4f16f8f343c9e18f2f36","observation_id":"38bed9a6-7783-490b-a08f-063e354bd693","resolution":{"observed_at":"2026-08-07T12:13:01.391953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.053360Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:01.053360Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:e40b85c5b62fafb9de8099b2c88129d0af28c7cf4268206d4eaec02876482634","observation_id":"6cb82dbc-6008-47ce-8d91-09beca49acdc","resolution":{"observed_at":"2026-08-07T12:13:01.053360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.213190Z","title":"and Lu, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:01.213190Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:c8015e0f38353264d93182178d413380626ffa8e2ba7dd49355c44381166955e","observation_id":"f5f1a679-ecbf-42ec-8793-0f69ebc1ae7a","resolution":{"observed_at":"2026-08-07T12:13:01.213190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.00388."}