{"as_of":"2026-08-12T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15b9d9156fd10d83b6c73689a7447733dae1cd22ffe19fcb55915711acae6e9e","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.18873/citation-record","integrity":"/paper/2501.18873/integrity","json":"/paper/2501.18873/citation-record.json","paper":"/paper/2501.18873"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2334029","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:18:06.221218Z","title":"URLhttp://www.jstor.org/ stable/2334029","venue":null,"work_id":"45705360-4dd0-4652-a94f-6f1423e0cc16","year":1952},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:c0723eabcb43cd2ffcab9e0d462aac0dcfcfa5d170fa25d2b2261e952281698b","observation_id":"7c957e81-5093-48bc-8e18-58bd8cce6e4b","resolution":{"observed_at":"2026-05-23T04:57:33.842172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11369","last_updated":"2023-07-16T21:57:10Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:16:25Z","title":"Bridging Imitation and Online Reinforcement Learning: An Optimistic Tale","version":2},"cited_work":{"arxiv_id":"2303.11369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.11369","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mohammad Ghavamzadeh, Shie Mannor, Joelle Pineau, Aviv Tamar, et al","venue":null,"work_id":"10cabe5b-d40a-4e65-a0d2-d747f1d7befe","year":2015},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"cited_paper":"/paper/2303.11369","citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:8221a7d47391fa021eb2e8e48175dd0d5bc2b54952a29e8f778b7c017b707e5e","observation_id":"9716bf0d-1090-4ba4-bbcc-d596d3baf637","resolution":{"observed_at":"2026-05-23T04:57:33.833975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1011.3027","last_updated":"2011-11-23T21:11:38Z","snapshot_observed_at":"2026-08-10T11:47:51.923745Z","submitted_at":"2010-11-12T20:20:28Z","title":"Introduction to the non-asymptotic analysis of random matrices","version":7},"cited_work":{"arxiv_id":"1011.3027","doi":null,"metadata_source":"pith","pith_arxiv_id":"1011.3027","snapshot_observed_at":"2026-07-04T08:09:41.057365Z","title":"Introduction to the non-asymptotic analysis of random matrices","venue":"math.PR","work_id":"695fe191-d99a-4805-9596-420902e88b7f","year":2010},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1011.3027","citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:15e286726460a602a8476893da68635aeabc08deab43f9a965422b097d6a5267","observation_id":"3b7bc4cc-0b50-4c67-af02-fbefef720f53","resolution":{"observed_at":"2026-05-23T04:57:33.791191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yes, please see Section 2","venue":null,"work_id":"3cdfdc71-e75c-4361-acde-db523156e4bb","year":null},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:f6e9385be52ef486213d717baaf41cd798a6666b1eebe9d35756ab57c4176b30","observation_id":"d612f9c0-d448-4efa-8b82-0411b37fac82","resolution":{"observed_at":"2026-05-23T04:57:34.012250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yes, please see Sections 3 and 4, and Appendix A","venue":null,"work_id":"ce69d52d-71f2-4402-b36d-398648f980ed","year":null},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:ced475c89e1b3be251b6b3e25a4a9783a8a548a83885ce51c9dc2d592982b7c8","observation_id":"c05d7186-4773-4fd8-bf18-3412c3960122","resolution":{"observed_at":"2026-05-23T04:57:34.003093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yes, code will be released later","venue":null,"work_id":"823c2547-3e64-4888-81b4-806806fdc0dd","year":null},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:c3da459546b1f2bad13c5973bbfc118b5c45742848268b16bf45ca93680e82dd","observation_id":"ef10d24e-7e89-475a-8eff-424e9868ba93","resolution":{"observed_at":"2026-05-23T04:57:34.009197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yes, please see Appendix A","venue":null,"work_id":"727a1f88-193e-4963-ab27-54cce64a1d0d","year":null},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:a1d43e809ebb4d68a29ce3ad79d4cb985a6c7086b0d317411404a653d5b52dee","observation_id":"08aae76b-2c3a-420e-96e3-23f5f470d362","resolution":{"observed_at":"2026-05-23T04:57:34.025666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xp1´xq.fis a concave function. We have for anyiP t0,1u, Prpπpiq k ‰π ‹q “E","venue":null,"work_id":"6578483b-2d9d-4ae4-bd6e-ebcedada4ed3","year":2024},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:767ca3eb0e3de2b9d616895647cb3d3e43bb043e95c01777743ed29cf1cc001f","observation_id":"f141bf8e-9d16-4764-82c8-be0a6d35d179","resolution":{"observed_at":"2026-05-23T04:57:34.015513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Notice that the eachchpsq is the difference of two binomial random variablesb1 „BinpN, 1 ´γ β,λ,N q andb 2 „BinpN, γ β,λ,N q","venue":null,"work_id":"d3e57abb-fd74-4071-abf1-587facde12bb","year":2024},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:e84858a73a210330a6508ed9c42dd497d8db5aede3685ed5d6af7ced5ab95c3e","observation_id":"22f8b4bc-eb67-4c6b-97ec-17f90f2be540","resolution":{"observed_at":"2026-05-23T04:57:34.018840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"argmax θ,ϑ,η Prpθ, ϑ, η|D kq","venue":null,"work_id":"0cb9de9c-1ad0-4583-846b-ba54b481c890","year":null},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:3aea06beb0fe9065f613d7cba5f2e665d464cab61e95b5762154523c5c6528c0","observation_id":"d16f3d24-4952-4cfc-a931-f76e293903b1","resolution":{"observed_at":"2026-05-23T04:57:34.006114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Similar idea has been proposed to estimate the expertise level in imitation learning Beliaev et al","venue":null,"work_id":"d6ad86e5-2cec-4220-a838-4242e08466b3","year":2022},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:a166af32c804cd036601e202922421bddd360fff9fcd6c1aedccfc450ad42a99","observation_id":"b140fbc3-57ef-40ee-8683-848dd13eb80e","resolution":{"observed_at":"2026-05-23T04:57:34.028926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1 diam ` Ft|xt ˘ ďα`Cpd^Tq `2δ T ? dT , whereδ T “max 1ďtďT diam ` Ft|x1:t ˘ andd“dim E pF, αq. Lemma B.8.If pβt ě0|tPNq is a nondecreasing sequence andFt :“","venue":null,"work_id":"e3d418c6-32eb-4c45-92d9-8b4a6c4c595e","year":2023},"citing_paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T04:57:02.705703Z"},"links":{"citing_paper":"/paper/2501.18873"},"observation_digest":"sha256:3a8fe403a1113234e5b054669381875511c09f87cf8ad83b28c684b533e8984a","observation_id":"c844c675-38e8-4251-b014-773d062a375d","resolution":{"observed_at":"2026-05-23T04:57:34.022420Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18873","last_updated":"2026-04-21T20:59:17Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:57:45.703184Z","submitted_at":"2025-01-31T03:55:10Z","title":"Best Policy Learning from Trajectory Preference Feedback"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2501.18873."}