{"as_of":"2026-08-07T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c56b84ec64b4c263240f4d84c5a989aebfa4065c2bc8e98f3e76ae8413d044b4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:52.380908Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:58:57.620585Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":"2408.10075","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-07-03T20:58:57.620585Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":"2943c895-e913-4c18-a3b8-9a24c5aae95d","year":2024},"citing_paper":{"arxiv_id":"2412.08812","last_updated":"2026-04-19T16:29:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-11T23:02:26Z","title":"Test-Time Alignment via Hypothesis Reweighting","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-23T06:55:54.051821Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2412.08812"},"observation_digest":"sha256:273d906c51317469cb9593a9de8b3dd02dc75e73e9bca2b82a013aba3c5a9486","observation_id":"cb318282-0a32-42fa-b0e6-2834b0a3daba","resolution":{"observed_at":"2026-05-23T06:57:40.526091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-07T14:39:52.380908Z","title":"Personal- izing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18071","last_updated":"2025-07-07T17:38:20Z","snapshot_observed_at":"2026-08-07T14:33:47.238687Z","submitted_at":"2025-05-23T16:16:46Z","title":"Extended Inductive Reasoning for Personalized Preference Inference from Behavioral Signals","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:52.380908Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2505.18071"},"observation_digest":"sha256:2c2f3bf02e7221b67f6aecb11dbe4f82522bc1f2823435e2064a7c2b2c89670d","observation_id":"46fd3c2e-fbc4-4ea4-ae96-ca85e99b6fc1","resolution":{"observed_at":"2026-08-07T14:39:52.380908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-07T04:08:23.797237Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11702","last_updated":"2025-06-13T12:17:38Z","snapshot_observed_at":"2026-08-07T04:01:53.225838Z","submitted_at":"2025-06-13T12:17:38Z","title":"Configurable Preference Tuning with Rubric-Guided Synthetic Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:08:23.797237Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2506.11702"},"observation_digest":"sha256:04f198ff68e498df033afd5d8bf7e520f23be890c043dd844c0c53281a2107ea","observation_id":"8d1d615b-98dc-469c-a8cf-fc480c450fee","resolution":{"observed_at":"2026-08-07T04:08:23.797237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-05T21:10:41.840114Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09342","last_updated":"2025-08-12T21:02:12Z","snapshot_observed_at":"2026-08-07T16:34:01.199757Z","submitted_at":"2025-08-12T21:02:12Z","title":"Affordances of Sketched Notations for Multimodal UI Design and Development Tools","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:10:41.840114Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2508.09342"},"observation_digest":"sha256:a856386cca69cfeddafc4616d930b37b92d6d1c96e80fa344ab2a5a3cd3b4626","observation_id":"a9ac34ef-cfd6-43e6-b9fc-2a83d87898d4","resolution":{"observed_at":"2026-08-05T21:10:41.840114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-05T10:54:12.137540Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03672","last_updated":"2025-09-03T19:42:50Z","snapshot_observed_at":"2026-08-05T10:54:05.383948Z","submitted_at":"2025-09-03T19:42:50Z","title":"SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T10:54:12.137540Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2509.03672"},"observation_digest":"sha256:5e50ac40612af323442978ab9104fda13b629046860e00af1f4af272a700077b","observation_id":"170584b6-cd83-4933-b97a-d3ddcbacea7a","resolution":{"observed_at":"2026-08-05T10:54:12.137540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-03T06:00:31.291700Z","title":"InProceedings of the 26th annual international ACM SIGIR conference on Research and development in informaion retrieval, pages 198–204","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.00742","last_updated":"2026-06-01T14:16:38Z","snapshot_observed_at":"2026-08-03T06:00:29.730285Z","submitted_at":"2026-01-31T14:13:06Z","title":"CURP: Codebook-based Continuous User Representation for Personalized Generation with LLMs","version":2},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-03T06:00:31.291700Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2602.00742"},"observation_digest":"sha256:0be06c1152b0f679b39651cfc6a219b699e12fbad4ee15663d9eaf90280b3612","observation_id":"32433d29-692a-4ba9-8ed1-d2402c47067e","resolution":{"observed_at":"2026-08-03T06:00:31.291700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":"2408.10075","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-07-03T20:58:57.620585Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":"2943c895-e913-4c18-a3b8-9a24c5aae95d","year":2024},"citing_paper":{"arxiv_id":"2604.09876","last_updated":"2026-04-10T20:05:51Z","snapshot_observed_at":"2026-07-06T22:58:38.807460Z","submitted_at":"2026-04-10T20:05:51Z","title":"Efficient Personalization of Generative User Interfaces","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T16:52:34.799158Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2604.09876"},"observation_digest":"sha256:81569c1c178ec279a4809d67caa6f519d40194827a995b7bda54f181c22a1c38","observation_id":"523a3b92-9d22-4554-bfec-28da7f1a675d","resolution":{"observed_at":"2026-05-11T08:00:57.579884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":"2408.10075","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-07-03T20:58:57.620585Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":"2943c895-e913-4c18-a3b8-9a24c5aae95d","year":2024},"citing_paper":{"arxiv_id":"2605.30873","last_updated":"2026-05-29T05:52:21Z","snapshot_observed_at":"2026-08-06T03:01:43.051785Z","submitted_at":"2026-05-29T05:52:21Z","title":"Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T23:21:35.338959Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2605.30873"},"observation_digest":"sha256:ec4f666c289b33b856240d7c69f2a865ecfe43fbd5ac6978895d740986748a13","observation_id":"22b13f78-f74c-4dae-859f-b921d38188f6","resolution":{"observed_at":"2026-06-28T23:22:46.659209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":"2408.10075","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-07-03T20:58:57.620585Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":"2943c895-e913-4c18-a3b8-9a24c5aae95d","year":2024},"citing_paper":{"arxiv_id":"2606.02300","last_updated":"2026-06-01T14:23:17Z","snapshot_observed_at":"2026-07-06T23:42:44.661608Z","submitted_at":"2026-06-01T14:23:17Z","title":"Beyond Isolated Behaviors: Hierarchical User Modeling for LLM Personalization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T14:51:27.110839Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2606.02300"},"observation_digest":"sha256:dc7f33b560ac8551f6a09fdf94bcfeacb7122703535034a3eb75e6bbfdaf77f6","observation_id":"fea0eeed-0edb-4c58-b0ae-098c20161292","resolution":{"observed_at":"2026-07-01T22:56:20.612219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":"2408.10075","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-07-03T20:58:57.620585Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":"2943c895-e913-4c18-a3b8-9a24c5aae95d","year":2024},"citing_paper":{"arxiv_id":"2606.17657","last_updated":"2026-06-16T08:16:17Z","snapshot_observed_at":"2026-08-05T08:43:46.082620Z","submitted_at":"2026-06-16T08:16:17Z","title":"Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T01:03:49.101568Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2606.17657"},"observation_digest":"sha256:86a82b4cd8ccd16bd03362a40c8949ec220173752d42a6e32766ecc828bb76b9","observation_id":"ac38de3a-4910-453d-87e6-e49889b16602","resolution":{"observed_at":"2026-07-03T20:58:57.622094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-04T01:06:55.741495Z","title":"arXiv preprint arXiv:2408.10075 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00215","last_updated":"2026-07-31T18:56:30Z","snapshot_observed_at":"2026-08-06T23:12:13.941911Z","submitted_at":"2026-07-31T18:56:30Z","title":"Personalizing Large Language Model Agents with Small Policy Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T01:06:55.741495Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2608.00215"},"observation_digest":"sha256:925b613d313b608c8ebd6c5aecb1b27af95e2b7ca1e65af521be979ef1f000f0","observation_id":"6541a1d8-99be-4956-8599-770a848228d5","resolution":{"observed_at":"2026-08-04T01:06:55.741495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.10075/citation-record","integrity":"/paper/2408.10075/integrity","json":"/paper/2408.10075/citation-record.json","paper":"/paper/2408.10075"},"outbound":[],"paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2408.10075."}