{"as_of":"2026-08-08T18:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e98ebcec192a1b5d1e4e1f504e0455979444ed6b0f612d3231e66ce498b0c800","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:51:35.789930Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T05:06:05.369793Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:50.303918Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"cited_work":{"arxiv_id":"2502.08759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08759","snapshot_observed_at":"2026-07-04T13:39:50.303918Z","title":"Contextual bandits with entropy-based human feedback, 2025","venue":null,"work_id":"1d4f7856-9cf8-4dd7-bf53-6a340ae3a92e","year":2025},"citing_paper":{"arxiv_id":"2606.26649","last_updated":"2026-06-25T06:23:15Z","snapshot_observed_at":"2026-08-08T17:14:00.301172Z","submitted_at":"2026-06-25T06:23:15Z","title":"Autoformalization of Agent Instructions into Policy-as-Code","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T05:06:05.369793Z"},"links":{"cited_paper":"/paper/2502.08759","citing_paper":"/paper/2606.26649"},"observation_digest":"sha256:dd2cf68c66772ac648f48a1221d2a96a269fd9961fcb1f6b145406ffa67099de","observation_id":"15283c2d-6fbd-4d8f-bf12-b5bff76920e6","resolution":{"observed_at":"2026-07-04T13:39:50.305589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08759/citation-record","integrity":"/paper/2502.08759/integrity","json":"/paper/2502.08759/citation-record.json","paper":"/paper/2502.08759"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T23:51:35.699578Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.699578Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:16a6b882f173fbd8e22f3aae323e4d29551d9e30f7396a67b80364d3fc8a5525","observation_id":"3b329e6c-839b-45aa-be4a-452e93697d19","resolution":{"observed_at":"2026-08-07T23:51:35.699578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.252456Z","title":"Survey on appli- cations of multi-armed and contextual bandits","venue":null,"work_id":"8f1dfd46-ad78-423f-9e10-fbc883199cc1","year":2020},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.728588Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:4cade7807c6ddee0a16e3a89256b6679577b38863ac0a9a35b55506a059f83b4","observation_id":"f42ea444-bab5-46ff-b8b5-c3776a0f9f52","resolution":{"observed_at":"2026-08-07T23:51:36.257362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.4009","last_updated":"2014-10-15T11:01:52Z","snapshot_observed_at":"2026-08-04T23:10:24.230738Z","submitted_at":"2014-10-15T11:01:52Z","title":"Thompson sampling with the online bootstrap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.4009","snapshot_observed_at":"2026-08-07T23:51:35.746581Z","title":"and Eckles, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.746581Z"},"links":{"cited_paper":"/paper/1410.4009","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:8bc349359d26f9bf0f367a6ec08cd965dfaf52b97cb9c7a4c8b8f308d6e149f0","observation_id":"043df074-a09e-41f9-ade2-37d263d88070","resolution":{"observed_at":"2026-08-07T23:51:35.746581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T23:51:35.756299Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.756299Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:52c3ab21b6c48b2206d21bdb6e00a77d65ed0c7e6d55fb6d6fc23f77b2d1ea6f","observation_id":"60c0043b-797e-44af-929d-60620289ba07","resolution":{"observed_at":"2026-08-07T23:51:35.756299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.223542Z","title":"and Lefebvre, S","venue":null,"work_id":"d518a5e0-ab4b-4f6f-8eec-b2ac6c07d54d","year":2018},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.765013Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:042a415b0d2d9de91ac20b5abd6ad5df8d15716576f707cfe9ec650a64fd77cf","observation_id":"6f654b1b-2411-418f-976b-9e2e4d522bcc","resolution":{"observed_at":"2026-08-07T23:51:36.227895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08816","last_updated":"2023-09-25T18:01:53Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:59:27Z","title":"Borda Regret Minimization for Generalized Linear Dueling Bandits","version":2},"cited_work":{"arxiv_id":"2303.08816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.08816","snapshot_observed_at":"2026-08-07T23:51:35.861750Z","title":"Borda Regret Minimization for Generalized Linear Dueling Bandits","venue":"cs.LG","work_id":"a273ebfb-ff68-426c-a55a-089d8fb49c78","year":2023},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.769075Z"},"links":{"cited_paper":"/paper/2303.08816","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:855104aff478120729002333b8893d226c65df01b94e35330ee8a7b6d1db5f3f","observation_id":"9a2641ea-dd53-4d65-83f8-4d8838d5908f","resolution":{"observed_at":"2026-08-07T23:51:35.866329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06781","last_updated":"2020-01-19T06:07:20Z","snapshot_observed_at":"2026-07-06T08:51:25.168612Z","submitted_at":"2020-01-19T06:07:20Z","title":"FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06781","snapshot_observed_at":"2026-08-07T23:51:35.773348Z","title":"Fresh: Interactive reward shaping in high-dimensional state spaces using human feedback","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.773348Z"},"links":{"cited_paper":"/paper/2001.06781","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:904c497a767d792f156bbd93957b70598bf1257fb4077ff77f999bbc478ae63b","observation_id":"3eb569e2-74e1-4e2e-b5be-a6537b2ea515","resolution":{"observed_at":"2026-08-07T23:51:35.773348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15188","last_updated":"2024-01-26T20:18:25Z","snapshot_observed_at":"2026-07-06T17:21:10.236126Z","submitted_at":"2024-01-26T20:18:25Z","title":"CAREForMe: Contextual Multi-Armed Bandit Recommendation Framework for Mental Health","version":1},"cited_work":{"arxiv_id":"2401.15188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.15188","snapshot_observed_at":"2026-08-07T23:51:35.823347Z","title":"CAREForMe: Contextual Multi-Armed Bandit Recommendation Framework for Mental Health","venue":"cs.AI","work_id":"e95bf522-9de4-485a-8326-524144be1a18","year":2024},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.778358Z"},"links":{"cited_paper":"/paper/2401.15188","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:e301e60e880dcfbbbd808bfa2b8e70bc9226f60ba3d9f97a62af86e8daaac42b","observation_id":"68945443-7639-49d9-a6f4-53eb5da189de","resolution":{"observed_at":"2026-08-07T23:51:35.829846Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.180895Z","title":"These connections highlight how our approach advances real-time feedback integration and decision optimization","venue":null,"work_id":"2ad72348-4129-4e09-9e4b-9250cabab72c","year":2014},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.789930Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:48105b3c1f4215e09eb42c2627861042cb7b6c041d0c9d7d1a04ced9b88325e3","observation_id":"b027f9b1-4418-4521-88de-50160e7142ea","resolution":{"observed_at":"2026-08-07T23:51:36.185489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03177","last_updated":"2022-05-12T20:49:55Z","snapshot_observed_at":"2026-07-06T11:55:13.881828Z","submitted_at":"2021-10-07T04:12:36Z","title":"EE-Net: Exploitation-Exploration Neural Networks in Contextual Bandits","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03177","snapshot_observed_at":"2026-08-07T23:51:35.714690Z","title":"Ee-net: Exploitation-exploration neural networks in contextual bandits","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.714690Z"},"links":{"cited_paper":"/paper/2110.03177","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:c3297e900b74ecb7c14b91ef4a3df18b44ae64bfa8790e9799a87ca5c092de3b","observation_id":"0f97e972-8758-4f94-8edd-8bf40a2ae367","resolution":{"observed_at":"2026-08-07T23:51:35.714690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18438","last_updated":"2023-07-03T13:08:46Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T01:18:39Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18438","snapshot_observed_at":"2026-08-07T23:51:35.751446Z","title":"Reinforcement learning with human feedback: Learning dynamic choices via pessimism","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.751446Z"},"links":{"cited_paper":"/paper/2305.18438","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:49ed6cd03e9bea2dae2969ace797d67cfd49f5574a9f5f3f5553deed0e36c343","observation_id":"e5f631b0-48e9-4dd1-8bde-3ecdd832eefd","resolution":{"observed_at":"2026-08-07T23:51:35.751446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.195270Z","title":null,"venue":null,"work_id":"db01c4dd-0fcf-462d-a3bd-60a66171487a","year":2024},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.786303Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:558ddf8573f6ded255109c4a32bb0bedee5026b5d117ee4402b16a6305872033","observation_id":"b1fc2aaa-78a2-40a4-ad5e-db4c9de09e94","resolution":{"observed_at":"2026-08-07T23:51:36.199877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.281778Z","title":"A neural networks committee for the contextual bandit problem","venue":null,"work_id":"26bb9f76-6daf-4f76-b595-3f10027b5509","year":2014},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.704685Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:a2b826467d2812df478a0671cd8bdb47b4a0e2a505400bc3da320ccc64968f24","observation_id":"924ee04e-f949-43f0-befb-3c9a2f7be854","resolution":{"observed_at":"2026-08-07T23:51:36.286247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.11748","last_updated":"2018-10-28T02:18:40Z","snapshot_observed_at":"2026-08-05T03:35:57.058707Z","submitted_at":"2018-10-28T02:18:40Z","title":"DQN-TAMER: Human-in-the-Loop Reinforcement Learning with Intractable Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.11748","snapshot_observed_at":"2026-08-07T23:51:35.709372Z","title":"Dqn-tamer: Human-in-the-loop reinforce- ment learning with intractable feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.709372Z"},"links":{"cited_paper":"/paper/1810.11748","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:d76751b5377f682bb6d753a4f13572ae929998ed3464e6f4aaeb9335584f8823","observation_id":"7c2b461e-b3f5-4629-ad64-d5ed89b25720","resolution":{"observed_at":"2026-08-07T23:51:35.709372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1112.5745","last_updated":"2011-12-24T17:53:19Z","snapshot_observed_at":"2026-07-06T02:40:01.191970Z","submitted_at":"2011-12-24T17:53:19Z","title":"Bayesian Active Learning for Classification and Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1112.5745","snapshot_observed_at":"2026-08-07T23:51:35.741570Z","title":"Bayesian active learning for classification and preference learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.741570Z"},"links":{"cited_paper":"/paper/1112.5745","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:f866ecdb0558ad1da68f4da4c172f5aab4def6117576d22557c84cb8b99c4c4c","observation_id":"dcd5ba6d-5710-4445-935e-463beb14eb02","resolution":{"observed_at":"2026-08-07T23:51:35.741570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12926","last_updated":"2023-07-24T16:36:04Z","snapshot_observed_at":"2026-08-05T01:25:35.347628Z","submitted_at":"2023-07-24T16:36:04Z","title":"Contextual Bandits and Imitation Learning via Preference-Based Active Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12926","snapshot_observed_at":"2026-08-07T23:51:35.760624Z","title":"Contextual bandits and imitation learning via preference-based active queries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.760624Z"},"links":{"cited_paper":"/paper/2307.12926","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:637cb4dff61a5d75ecdbf4c1a1289b3df2057ac7777c3a38476e1bd93a016b29","observation_id":"da1357dc-0c76-444e-a6f2-231d2566678c","resolution":{"observed_at":"2026-08-07T23:51:35.760624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.237488Z","title":null,"venue":null,"work_id":"f5552bee-9a2e-4210-911c-70ec5c48dddc","year":2024},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.732765Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:244b91b86e0cc03ce765c2d1b2bb03a5f2e993160f591afa53859fdb0e80e826","observation_id":"1463b229-62a1-4005-a5c0-993563767aef","resolution":{"observed_at":"2026-08-07T23:51:36.241736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.209450Z","title":"We draw inspiration from Tang and Wiens (Tang & Wiens, 2023), whose counterfactual-augmented importance sampling informs our feedback framework, and extend DAGGER (Ross et al.,","venue":null,"work_id":"8b19d68b-dae5-4608-9060-bfa36a4cc6b9","year":2023},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.782304Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:63fff329b8827587766f419e1e65766c84bdb8d8722b5d9175d0533a260b80fd","observation_id":"8f0b24d6-f70e-4d5f-bc2c-b702d3fc6260","resolution":{"observed_at":"2026-08-07T23:51:36.214241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07186","last_updated":"2023-06-12T16:52:27Z","snapshot_observed_at":"2026-08-04T20:46:45.431076Z","submitted_at":"2023-02-14T16:54:22Z","title":"Adversarial Rewards in Universal Learning for Contextual Bandits","version":2},"cited_work":{"arxiv_id":"2302.07186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07186","snapshot_observed_at":"2026-08-07T23:51:36.120017Z","title":"Adversarial Rewards in Universal Learning for Contextual Bandits","venue":"stat.ML","work_id":"6a2a841b-ddb2-4774-aad3-ed557ef5653f","year":2023},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.719330Z"},"links":{"cited_paper":"/paper/2302.07186","citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:6e678833c077ab852bd01cf49d2239b0e385291b026b865c2fc79f75851b4e72","observation_id":"8defbab9-48ec-4a59-985a-af04f1c8837e","resolution":{"observed_at":"2026-08-07T23:51:36.125117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:36.267707Z","title":"Contextual bandit for active learning: Active thompson sampling","venue":null,"work_id":"f85bc2c5-ca74-4f51-8cc0-5060009d3f69","year":2014},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.724103Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:647755b5bae44a912a1c4b8b19b23447e55c105b912f0bd3de998621e8047727","observation_id":"af5bd6da-e7f1-4604-aa21-281231ee939f","resolution":{"observed_at":"2026-08-07T23:51:36.272001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:51:35.737043Z","title":"Nearly optimal algorithms for con- textual dueling bandits from adversarial feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T23:51:35.737043Z"},"links":{"citing_paper":"/paper/2502.08759"},"observation_digest":"sha256:bd932232e37023c33f5e95be5faaab99034430156b38347aaa765cc4f3962ec6","observation_id":"41d1a8fb-302e-4ddf-8cde-1e20dcaff48e","resolution":{"observed_at":"2026-08-07T23:51:35.737043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08759","last_updated":"2025-02-12T20:03:56Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:43:56.290356Z","submitted_at":"2025-02-12T20:03:56Z","title":"Contextual bandits with entropy-based human feedback"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2502.08759."}