{"as_of":"2026-08-20T01:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87bcc155566c2ccc6dcdb33b9a75b8652e2456f3efcb2e42128d1757dd03868a","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:09:23.923258Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14192/citation-record","integrity":"/paper/2607.14192/integrity","json":"/paper/2607.14192/citation-record.json","paper":"/paper/2607.14192"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.394175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.394175Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:81719adf6d3c57aac4272cab973f1d7fcd92d653fdbbd3a0e27752802f4ce3b7","observation_id":"48be9286-1225-4d63-ac80-05a531777312","resolution":{"observed_at":"2026-08-02T03:09:15.394175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.447859Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.447859Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:b5d2446efa6930508a2dd75b1c2b427748aaf7440e8acb5d9130e34b234514e7","observation_id":"7ccd0f1d-01e2-4988-b954-06e99bd32659","resolution":{"observed_at":"2026-08-02T03:09:15.447859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.593822Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.593822Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:2337f67c0ee597de9438c1f209ec6699f46a4cddeb2dd286b10b956314a0501e","observation_id":"52eacf3c-053a-439f-ae44-753b534bb81e","resolution":{"observed_at":"2026-08-02T03:09:15.593822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.727688Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.727688Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:78d4a6257dc7e00df617f3df73bc34ac4e70b58d589251f10d3542cd5e50e6b8","observation_id":"3af8f5d9-cede-4b9c-9338-004b8aea8622","resolution":{"observed_at":"2026-08-02T03:09:15.727688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.807945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.807945Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:8f6eb21a4b2c2a45130618db5e96ae9722af17f4b44d9f68db49af56d4d8c233","observation_id":"a0b4e19f-8668-473c-8bae-1aeb34ace303","resolution":{"observed_at":"2026-08-02T03:09:15.807945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.883212Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.883212Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:b45adb6f7c1b7baed17700077d775b3ed1fe9213b277f7d5264b4894c033cb0d","observation_id":"10142af7-73e3-4697-b672-b1f601703a0a","resolution":{"observed_at":"2026-08-02T03:09:15.883212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:16.120587Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:16.120587Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:7d13ccd88d3abf18b1cb0c4dcc042216c91d10716cce8d32b7cada69145f4d61","observation_id":"c40199c4-4d68-4684-b69a-a755bc02d61d","resolution":{"observed_at":"2026-08-02T03:09:16.120587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:16.278715Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:16.278715Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:c5302a06638353f4db0e06a318b7e8ac98c6095424eccd39e5af889a1b54f692","observation_id":"aeec410c-0d56-4aa7-99e6-b9d70f7ff344","resolution":{"observed_at":"2026-08-02T03:09:16.278715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:16.478632Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:16.478632Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:08b39bbf4444ccb54d600cd44de1640315cf6b02c9197118e33e08406d0f9d73","observation_id":"0ced6799-b77d-413b-9652-621b070f3b90","resolution":{"observed_at":"2026-08-02T03:09:16.478632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:16.640998Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:16.640998Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:a6785af544eb3953fc64adb4573e20eef23942875a409d63d8c1c19da605456d","observation_id":"d059d1a2-26f6-4b81-94c0-7331b65fde29","resolution":{"observed_at":"2026-08-02T03:09:16.640998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:16.735380Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:16.735380Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:8985bf2eb7181726a3212d79f7e57cfe95bc0d9f9932ad2ce82c5d9793908c61","observation_id":"9db60c4c-76eb-4cee-b716-b2227b6c5996","resolution":{"observed_at":"2026-08-02T03:09:16.735380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:16.895087Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:16.895087Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:d0655e8f9e187c12bfc2215574fc060f3f2915caeb1918b2f7287750975d72a7","observation_id":"99fd7cda-617a-4980-80fe-78e45d00101c","resolution":{"observed_at":"2026-08-02T03:09:16.895087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15166","last_updated":"2022-09-30T01:29:12Z","snapshot_observed_at":"2026-08-16T16:27:59.669635Z","submitted_at":"2022-09-30T01:29:12Z","title":"Reward Shaping for User Satisfaction in a REINFORCE Recommender","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15166","snapshot_observed_at":"2026-08-02T03:09:17.191622Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:17.191622Z"},"links":{"cited_paper":"/paper/2209.15166","citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:b1f682fb9a530ad8c07b51d24d40c961b05ae4b5402405699ce0415b32424fd6","observation_id":"de8a950f-f56c-4728-9aa3-ccdb203a9998","resolution":{"observed_at":"2026-08-02T03:09:17.191622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:17.358969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:17.358969Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:65131d3614bbf7fe5087c25c33a6a4c57e9b386d1cad8dd5e87222e733ae7550","observation_id":"73bd3fe8-bdbb-4240-8b9d-d4616aef3ce9","resolution":{"observed_at":"2026-08-02T03:09:17.358969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:17.468035Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:17.468035Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:b43d57fbb8fa66bf0295a9c483815de8275ee903feaff7fe82bfc2180c80a36a","observation_id":"7bd13d53-64ab-4ff9-a7ec-e2063bffccf1","resolution":{"observed_at":"2026-08-02T03:09:17.468035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:17.632237Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:17.632237Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:80f7674b629f78ad7c9d1465d411deb4f8919636447b54dba3263a79b80864cd","observation_id":"2a43b499-a21b-4c3e-abc5-790951f76095","resolution":{"observed_at":"2026-08-02T03:09:17.632237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:17.789211Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:17.789211Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:1aead9bd356561aee1d0c7accbe4aec2f636d0563cf9ba943ef104e9e082a22b","observation_id":"0849da4c-f3cd-4c5f-abd0-e182d6134e7b","resolution":{"observed_at":"2026-08-02T03:09:17.789211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:18.119219Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:18.119219Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:2f460630f0d01550b4743d60de39cbe06232b15986725cfdfa8a7aef087ddd2c","observation_id":"3ec198e3-6f31-46cf-968c-83a4a33b64a9","resolution":{"observed_at":"2026-08-02T03:09:18.119219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:18.234762Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:18.234762Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:43dccfc40371d27c08bfb973c9d89453c7a267273fe91feabc20d58737cefbe8","observation_id":"dc1a9b5f-2fd3-4b01-a1f0-2962f426279c","resolution":{"observed_at":"2026-08-02T03:09:18.234762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:18.397096Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:18.397096Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:306a042a5df6c0a99c2572467043962e27ea604220b2b421054841397949bb9b","observation_id":"e43c940b-d1bd-4452-989d-e0669c7beb64","resolution":{"observed_at":"2026-08-02T03:09:18.397096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:18.566982Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:18.566982Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:5f20dad1186c16f39e0746a46da24347645a4e40fb195f6a583975f3506324ac","observation_id":"6f38dd3f-aa1d-4150-939f-8ce4ca01bd8d","resolution":{"observed_at":"2026-08-02T03:09:18.566982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:18.721185Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:18.721185Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:78c7fc3a28b3e93598122ec246a7d11dc9f20b70a8c504c8e99d907745b644fb","observation_id":"ccbce639-46e7-44f7-a666-897212d8ef05","resolution":{"observed_at":"2026-08-02T03:09:18.721185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:17.955311Z","title":"InProceedings of the 30th ACM SIGKDD conference on knowledge discovery and data mining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:17.955311Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:133a6c8502802547d1fcbe680a846c1186d0e487c0170a17e230229f98a6e73f","observation_id":"10e501cb-adbe-4a8b-8239-57164cca9a89","resolution":{"observed_at":"2026-08-02T03:09:17.955311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.046693Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.046693Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:06cf6c8bd5f91281dacd52a32c66e9385e8ba53feaa8dfb7f53bc142bc2c9982","observation_id":"d3daf0b5-c922-4cc0-9e85-28e543af6626","resolution":{"observed_at":"2026-08-02T03:09:19.046693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.212779Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.212779Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:3623dbf519d5a257c41b3efe74d4c1bd9aafab79c7d71d05eb8b5dff320d9219","observation_id":"2bb14d0b-ddb0-424d-a963-8be0fb913929","resolution":{"observed_at":"2026-08-02T03:09:19.212779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.378850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.378850Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:636881078c1ce620fdffc410d622d5496dc68260cf0d5b3c7817914cb60c7934","observation_id":"47748abf-b3dc-4135-840f-bda6497e1d92","resolution":{"observed_at":"2026-08-02T03:09:19.378850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.477668Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.477668Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:a628c70edb424e040e3342c92c21f8a6f47c15ecb93b783472e4e979abb45421","observation_id":"ff7e4f7b-b22f-4bdd-bb10-61c76c72edf1","resolution":{"observed_at":"2026-08-02T03:09:19.477668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.627537Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.627537Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:733f378f9b84c6a598936abfa73af3855fdc22492e8046adeaebcc99c2c5b2f2","observation_id":"29278e85-b596-41ad-aa66-0349d4d417c2","resolution":{"observed_at":"2026-08-02T03:09:19.627537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:18.894880Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:18.894880Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:d87b9f5296b4df48fd41ec621f53d516226ef470eb2ce51fed406058701f728f","observation_id":"10ee4c83-4cbb-4c81-8116-cf84e6b4f201","resolution":{"observed_at":"2026-08-02T03:09:18.894880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.922026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.922026Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:a4780feab829459bb5df438851c46dbd60619980f425b416f3df3af86aace1d4","observation_id":"22085188-6c97-4b2f-af1d-554c9514c07b","resolution":{"observed_at":"2026-08-02T03:09:19.922026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.087978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.087978Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:c8711c3558ada51059547106b7811b99ea2a7ff2379c995e2867b8536cf89371","observation_id":"60887694-c469-4c6b-bd68-621c362c6b4f","resolution":{"observed_at":"2026-08-02T03:09:20.087978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.254028Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.254028Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:5c69d500e26f98cb85c8e12883dd90839e3b4af5272461011cf451203e55ebb5","observation_id":"feead1c4-d2cf-4461-a141-ea4ce3da52a1","resolution":{"observed_at":"2026-08-02T03:09:20.254028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.361631Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.361631Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:1e40fd682b202b030fa6b6efac20857279e79f4da587a87c3186eb75ada9f47c","observation_id":"01343eb9-e0ce-4a36-988c-946748c084d3","resolution":{"observed_at":"2026-08-02T03:09:20.361631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.517752Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.517752Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:525c1ea7c96d7c556fc02b57b2aad03486a87e31e0ee4b4537b44154792a93f9","observation_id":"1db41e02-7e65-46ec-8b89-dc000f6fbe15","resolution":{"observed_at":"2026-08-02T03:09:20.517752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.795605Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.795605Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:b9adbe76910bb574ee2aec088425c9512b20ede0a1a0c4207715abfd9efe68c8","observation_id":"267cd079-2efa-4e1b-b4d6-eebae0c3c175","resolution":{"observed_at":"2026-08-02T03:09:20.795605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.766291Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.766291Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:96065ad8cf0e57387415400c35caf24c2a21eb65d99a3d5d041155b3fe2f0522","observation_id":"385fcc96-7327-4593-89b7-88297fef2de6","resolution":{"observed_at":"2026-08-02T03:09:19.766291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.994065Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.994065Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:502f8a41599dfbc65ab40ba16824a7668cd06a1c9e1fe63487bcd638b64f869e","observation_id":"a1c3667d-09d6-4232-90f0-efac0d38b29e","resolution":{"observed_at":"2026-08-02T03:09:20.994065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:21.100768Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:21.100768Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:7727cbac8d1e0d33f15137ad5efe3933d5e327f7e54f642872e094f52189b61c","observation_id":"c585a353-6306-456f-8df2-4ab9160d6e3a","resolution":{"observed_at":"2026-08-02T03:09:21.100768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:21.186985Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:21.186985Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:abc7bb64b025916b20754d35ece657a5dca1ec450ca27db0ec22d3d01af9bbfd","observation_id":"9103afd4-f779-45cf-b062-a25ca11c2183","resolution":{"observed_at":"2026-08-02T03:09:21.186985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:21.293342Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:21.293342Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:08e34dc9cb53ad764007c6ef1d7166906a918cd64334f1e32ba47e4f49ad8638","observation_id":"310efab3-010f-487b-b3e2-9f692f9f0e98","resolution":{"observed_at":"2026-08-02T03:09:21.293342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:21.654594Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:21.654594Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:6583aacb40a7776b39917aeb8120b7b1c8a7c9edeeefb1f46664ce56e94eff27","observation_id":"e2956fb9-3399-409c-82b2-e74fbe7a8183","resolution":{"observed_at":"2026-08-02T03:09:21.654594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.687110Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.687110Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:a7b09bec5b18cabc9ec6287645de62d342bb887b136716c7c9df7665eb70682e","observation_id":"00ed8fce-889b-43ec-9595-b5f68fc9b6fe","resolution":{"observed_at":"2026-08-02T03:09:20.687110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:21.987480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:21.987480Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:93e3722f4c262c6aced2e3cf96bab34940ef6fdd18dbc1c412d0a9b3aea4778a","observation_id":"4de4d8a4-acdb-440f-ac91-ca3ed812f2a6","resolution":{"observed_at":"2026-08-02T03:09:21.987480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:20.881313Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:20.881313Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:fc523f88daa165c87e140d9f633be5b4945b58084909ba6d4d29614fa08319f5","observation_id":"197ee391-0711-4c64-beef-d3bfca7a5429","resolution":{"observed_at":"2026-08-02T03:09:20.881313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:22.376155Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:22.376155Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:e3f930459ea7c00c54b6638e27f2936f55a8c57179d73f264ba65d7948ab40d2","observation_id":"0dfd996a-f306-4ae7-87e2-34fc0529f910","resolution":{"observed_at":"2026-08-02T03:09:22.376155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:22.543775Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:22.543775Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:1fee4e7147f06a7744c5046ae080f20089d172d66a5d60d650571f4d06abc540","observation_id":"9ef3e7f9-6784-4128-b8f2-b3c38923ff8a","resolution":{"observed_at":"2026-08-02T03:09:22.543775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:22.691113Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:22.691113Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:8d5aca66ed1c874fee281338ec7a9a42eac262fd49186d3ba775a4290ec59b12","observation_id":"a379b3cb-e26e-4eaf-950c-a6b1606cabc9","resolution":{"observed_at":"2026-08-02T03:09:22.691113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:22.827916Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:22.827916Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:74d3ed198b0647fdd555dcca5c5a6cffc038a63f4c14c8fbd06a914494c64dae","observation_id":"e3a19bdc-c7dc-4faf-875c-1f93b4e6c7f0","resolution":{"observed_at":"2026-08-02T03:09:22.827916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:21.489707Z","title":"InProceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:21.489707Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:403dc33f6b04ef8ed3273caf95fbca6f9d96a10f24a67176ffe129ee7c731aed","observation_id":"35f5f33c-4db9-4a65-adc4-555178d37dfa","resolution":{"observed_at":"2026-08-02T03:09:21.489707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.093427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.093427Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:ab6cf89488728ead3231a0983847b053292f9b7e5d52e62a0eb2493de15e3a67","observation_id":"2e01de13-f6ad-4630-bdd1-e5530968e748","resolution":{"observed_at":"2026-08-02T03:09:23.093427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:21.826862Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:21.826862Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:d59e659bcba4b6a3162beffb8ad882e393ced99e39d48c6e25572696009abd0e","observation_id":"57c1d925-8baa-437a-b14d-9f95c8fc9078","resolution":{"observed_at":"2026-08-02T03:09:21.826862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.216646Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.216646Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:612f21a6c33f2471071c7842f6def424dfe2b3817d8713cec5faebdd6692b4b7","observation_id":"d5a86585-fb36-4f1d-9811-0c4314bdde39","resolution":{"observed_at":"2026-08-02T03:09:23.216646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:22.198231Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:22.198231Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:cbe3544541f775f66be0e2545df8043b68309edc0272f144678a400f63cce207","observation_id":"dd8c1f79-b3e6-4358-a5de-ede824325ac1","resolution":{"observed_at":"2026-08-02T03:09:22.198231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.330688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.330688Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:fb27fb8f2d31e6afa34509b3e4df74c2ef3672f030c7044ab315f4e01a3f3590","observation_id":"d3894782-0bb1-4b96-847b-939c75e754bb","resolution":{"observed_at":"2026-08-02T03:09:23.330688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.460252Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.460252Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:5ffb979183f36141a10a483f15681e5f19bfacea4d2efab694c93d0cc08a8bb7","observation_id":"f525f0e5-13c9-404b-8368-efceea3f17bf","resolution":{"observed_at":"2026-08-02T03:09:23.460252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.520664Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.520664Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:0a9e1be75ac5fcac63bba22c374c9fd34d8930a318962870177273bf90f11e9d","observation_id":"885e4098-1e71-458a-874a-f67d5ea9469b","resolution":{"observed_at":"2026-08-02T03:09:23.520664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.539853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.539853Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:79b60527cb1aa3a6ba094c24e8e7f7b66e1bd567c8085b82385f8d0d0f3b73bc","observation_id":"848dc747-7121-4659-a4a3-4f28d6dc7a1c","resolution":{"observed_at":"2026-08-02T03:09:23.539853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:22.974854Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:22.974854Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:77cbc0f58310e248b8ba3ff67e48c4ddfe52dc2e7510d9591a2158761f909c74","observation_id":"6ddda7c7-4c28-4a3b-8efd-608bf0db2b96","resolution":{"observed_at":"2026-08-02T03:09:22.974854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.824445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.824445Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:80ca2440a473d24b487ca7999d3e123ebedb2220023a5362346fa07a9b62aa12","observation_id":"b55e74d2-29d0-4c76-b016-7702a8460327","resolution":{"observed_at":"2026-08-02T03:09:23.824445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.162588Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.162588Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:2a67686e6041c047a9e66b96e00bd2a6364f0f38424c04985d2e1e08d12dd869","observation_id":"173207e3-0987-4258-8917-05f7fdf8f06a","resolution":{"observed_at":"2026-08-02T03:09:23.162588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.275643Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.275643Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:5ff0570d2e18d0f223d0e9bdd85ff83f9db1248a63a3c40039f46cb03810aa43","observation_id":"d9e5016d-cfc7-4f56-835a-736947e7ddd7","resolution":{"observed_at":"2026-08-02T03:09:23.275643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.677500Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.677500Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:159349ed37fb986ff59f500789b0a108b0e0a5767e0cadabb8eb581c6a3beacd","observation_id":"861d35e2-fee9-45bc-953a-8d115f8ab413","resolution":{"observed_at":"2026-08-02T03:09:23.677500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.923258Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.923258Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:23f3b05e41ab8b33a32a3f64ca46e12dacdf4a74ceeb760b579884afdd5eaf8e","observation_id":"a14c31a8-eacb-425c-9879-06b7ec57ee95","resolution":{"observed_at":"2026-08-02T03:09:23.923258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.650178Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.650178Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:b0bad6310a88fcd7eca66ed282a3894add79390114c1271a59c599c86fbdf7ce","observation_id":"cf67b4f0-6dd4-451c-ad20-b8ec634e07de","resolution":{"observed_at":"2026-08-02T03:09:15.650178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:17.079542Z","title":"InProceedings of the 1st workshop on deep learning for recommender systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:17.079542Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:d6b79d8774448bd9cc919c99d50fd1d96cace981430b3ee2913371970e3aa295","observation_id":"60511bef-a9b6-4798-b2f3-110d5863ba16","resolution":{"observed_at":"2026-08-02T03:09:17.079542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.947336Z","title":"InProceedings of the 26th ACM SIGKDD international conference on knowledge discovery & data mining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.947336Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:51516cae1667477624ce5983b6a3ff6d47279265d0c2b84767114d96339eb2ec","observation_id":"4e4f5801-0614-414b-bd51-513e17c5afc9","resolution":{"observed_at":"2026-08-02T03:09:15.947336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:23.386901Z","title":"InProceedings of the 44th international ACM SIGIR conference on research and development in information retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:23.386901Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:1bfc47555c4e651a568a563dae04fd791eb8454c194567a7a3f920fc11433c6c","observation_id":"524a9c03-97f7-4d1e-8426-b62d6f53660c","resolution":{"observed_at":"2026-08-02T03:09:23.386901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:15.515676Z","title":"InProceedings of the ACM web conference 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:15.515676Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:09ab6b0d51153aea23e8745b4ac99e9595202487d7fa818cdfb3975e770961b8","observation_id":"4442b531-ce5b-4ed9-a5f5-de792563baa5","resolution":{"observed_at":"2026-08-02T03:09:15.515676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:16.670883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:16.670883Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:b9af21ab4d8fa9a8cdb5e3792276368cb5acf42d55e9ca4ae9cb6f29727e6c02","observation_id":"df70ed43-23e1-40f8-8d12-b448ecb1483c","resolution":{"observed_at":"2026-08-02T03:09:16.670883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:09:19.350024Z","title":"InProceedings of the 2025 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T03:09:19.350024Z"},"links":{"citing_paper":"/paper/2607.14192"},"observation_digest":"sha256:08b1eb97dfc0a957e6cfdf5437e8136f4fc5b5762a8c8a3952bfb9431703350e","observation_id":"61e12ed5-8887-4a53-bb32-fed15775ac63","resolution":{"observed_at":"2026-08-02T03:09:19.350024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14192","last_updated":"2026-07-20T20:30:04Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T05:00:40.872198Z","submitted_at":"2026-07-15T16:17:58Z","title":"Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2607.14192."}