{"as_of":"2026-08-05T10:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8701cf2ce942d8cf743c434bec6f129ed794366170737081bf09333b8e796bd0","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:53:14.015388Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.22211/citation-record","integrity":"/paper/2601.22211/integrity","json":"/paper/2601.22211/citation-record.json","paper":"/paper/2601.22211"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.310018Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.310018Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:a59bfd04715bd877d34abe51c86ba498b303d2dba8e95b8010384add90dffb9f","observation_id":"41be6fb3-8e07-4e82-9e14-8525a8a2aba0","resolution":{"observed_at":"2026-08-03T06:53:13.310018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.488156Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.488156Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:041e9ca387dddb075b1eba786bb4a9b91b4241c716733fae6de9d8c927359351","observation_id":"9b73690d-616f-4ff5-b036-bf7341fa8a84","resolution":{"observed_at":"2026-08-03T06:53:13.488156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.067294Z","title":"Poganˇci´c, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.067294Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:5f592bfd5eb56a0edf7204e3f3ad9a8d3f863f2f8852af86a891bb4ca33209c3","observation_id":"306bfc9e-1f4b-4218-8dc0-c49469b15538","resolution":{"observed_at":"2026-08-03T06:53:13.067294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:14.015388Z","title":"OnceX t(v)∈ {0,1}, it remains fixed for the rest of the episode","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:14.015388Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:9657c346c6dc6c377925ca9550c54e4808a40791660d79221e28214b18e8973e","observation_id":"68f61645-9c4f-47ab-8769-2e31f30e66e2","resolution":{"observed_at":"2026-08-03T06:53:14.015388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.585889Z","title":"Proof of Theorem 3.5.Recall the smoothed Bellman operator in Eq","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.585889Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:628b86bf9a8627005982494792e2acdb1e0010669c3bc4a373d3e0db90410fab","observation_id":"594d51a4-cb0f-407e-8f7c-0cef19aaf14d","resolution":{"observed_at":"2026-08-03T06:53:13.585889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.741852Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.741852Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:751cbf1d84cbe07a13a756490b2b3901921cf97bbb31c1b87a7e9637ac85bed8","observation_id":"201a3b81-ccee-40e1-b59b-7d7e776ce690","resolution":{"observed_at":"2026-08-03T06:53:13.741852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.792049Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.792049Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:a42ebc13732c5fd12f97fdacf968e6bf0a573dfdb1fd4d9535f61848196902d5","observation_id":"8897b223-7fa8-47f1-83f0-bf1886e96ce4","resolution":{"observed_at":"2026-08-03T06:53:13.792049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.903083Z","title":"The immediate reward at time tis Rt = X v∈At r(Yv)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.903083Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:9a931c6642e02d0b4810539460d925e653c5e751eb3c3c3a95a31294b7464225","observation_id":"3ca55a59-0eb9-4e65-a4fa-8195611bb224","resolution":{"observed_at":"2026-08-03T06:53:13.903083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:53:13.224156Z","title":"Define the strict-optimality cone Ka := c∈R m :c ⊤a<c ⊤a′ for alla ′ ∈ A \\ {a}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:13.224156Z"},"links":{"citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:2f285e180f49bedd6590733cf2bc0cd70301cd15423a166dee7aaf148552b53a","observation_id":"c2ba938c-553c-429c-908a-ba0c0096ddcb","resolution":{"observed_at":"2026-08-03T06:53:13.224156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00577","last_updated":"2023-11-27T15:57:06Z","snapshot_observed_at":"2026-08-04T11:13:29.232025Z","submitted_at":"2023-06-01T11:45:45Z","title":"TorchRL: A data-driven decision-making library for PyTorch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00577","snapshot_observed_at":"2026-08-03T06:53:12.919775Z","title":"predict, then optimize","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:12.919775Z"},"links":{"cited_paper":"/paper/2306.00577","citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:4251a365b6d7da86c9515644f2dfbb13da2f88cefaee62b275df8a6bdbe5977d","observation_id":"d07b044f-25ac-4f1c-88f2-8959263c01fc","resolution":{"observed_at":"2026-08-03T06:53:12.919775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T06:53:12.982267Z","title":"Kang, B., Ma, X., Du, C., Pang, T., and Yan, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:53:12.982267Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2601.22211"},"observation_digest":"sha256:aa97eb12a9bdc023f22fa7d6e83dc7fdd4292e0ad1467dafec984bf3aa043ab0","observation_id":"bba57258-5cac-4815-bcff-19ad5145b34d","resolution":{"observed_at":"2026-08-03T06:53:12.982267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22211","last_updated":"2026-06-06T22:36:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T06:52:56.757064Z","submitted_at":"2026-01-29T18:49:07Z","title":"Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2601.22211."}