{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27459d65219d93bd9559cb9ee5884872ae38ebfb7f31f7cae1d26d599efd9e97","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:26:24.074391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29782","snapshot_observed_at":"2026-07-12T04:26:24.074391Z","title":"Prateek Chhikara, Dev Khant, Saket Aryan, Taranjeet Singh, and Deshraj Yadav","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03162","last_updated":"2026-07-03T10:03:35Z","snapshot_observed_at":"2026-08-05T10:47:31.437333Z","submitted_at":"2026-07-03T10:03:35Z","title":"APeB: Benchmarking Personalization Ability of Large Language Model Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T04:26:24.074391Z"},"links":{"cited_paper":"/paper/2605.29782","citing_paper":"/paper/2607.03162"},"observation_digest":"sha256:52145b896b009a0c52a30454ed46b919302a650a18eaac6f3075fae2df522a23","observation_id":"f36e8105-ebcc-453b-9b13-0eabe99137a5","resolution":{"observed_at":"2026-07-12T04:26:24.074391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.29782/citation-record","integrity":"/paper/2605.29782/integrity","json":"/paper/2605.29782/citation-record.json","paper":"/paper/2605.29782"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":"2110.06169","doi":"10.48550/arxiv.2110.06169","metadata_source":"pith","pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":"cs.LG","work_id":"4adca4ff-8975-49b3-aee4-2ef7e0f95275","year":2021},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:d457e08fa039d6af3f4843f851d98da7b2b8d07765039f7937ec8fd89d03242c","observation_id":"c6e7e5f7-7236-48cd-a1f1-03b73300bfd1","resolution":{"observed_at":"2026-06-29T08:43:15.445367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:2284e3518d7841ad12895ed6a019c7e4ca004a1e317b297a9edc24c10ef86e99","observation_id":"29c8779f-fdda-409e-80f1-508e656c1a1f","resolution":{"observed_at":"2026-06-29T08:43:14.669708Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:219793c8c010eaa8e0204012d59e1c1452f57a8383b2fcdff9869ea6204a2035","observation_id":"0a303672-891d-4b0b-9604-177825d56b39","resolution":{"observed_at":"2026-06-29T08:43:14.666563Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"Assumption A.1(Answer Parsing).The final answer for both states is parsed from one action a, which corresponds to one token","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:0565b79a079a4d45af6aa229e8653e12517ad1baebc7758f15e332ce2801efe4","observation_id":"5f312830-4cf0-4aa6-affd-cbadde38aa03","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:f873f05c40ceb852c50a47e165db24c3523252f71b84a1fa1614adc070f19686","observation_id":"d212c651-8b0a-4eaa-b0c5-a1c230eb079b","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"Thus, the corresponding eigenvalue isλ ∥ = dϵ ∥x∥2 2+dϵ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:950be3f2ab423cd61110be81ced7a099e738adb40edf23fde9f443fbb724e55f","observation_id":"4fab8912-a53d-4dbf-8ea5-5f512bcc4d39","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"Suppose we continue the generation of s1 and s2 until (T−1) -th state located at the token index ℓ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:a3b368c0e1689fcaf5f184e50ea85889252725e7db1379c4a95b0731ec2bfd07","observation_id":"f473ed68-7dda-4f91-8346-1d113bd5bf45","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"A General Case In previous section, we only prove the correlation between MinDistanceof hidden states and final reward in a simple case, where","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:f24b304ac638077fa35bfa8000847996be6fe8660f5914949d41a958ca6525b5","observation_id":"c78888f1-c705-46c0-b21e-f0723b0e069c","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:8a9a192fc87c8d7e077c842574504e608e29510bbc3dca82c76076951ff235f9","observation_id":"be727993-136a-4e6c-8cbd-2ead0138ad68","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:eff0ea7853a6f70a9147a8a2f4c233a1f1c00c6c0fd5004de5adf514f054d2be","observation_id":"7956b08b-ea97-42dc-be55-b03b2198d1ae","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"To expand Theorem A.11 to general case, we need to re- view these three assumptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:f06384521883349bac06c7d2af90cbc88c10572c5e2a14f0ad5dab6c8f171c6b","observation_id":"5831e3c3-ec11-4cef-a11d-a72dbd323a95","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"Now, the problem becomes, the relation between the final reward of ˆs2 and s2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:24d9890cc560fa31e1ecc7c403d0f28393bf5d253ecc7684378eea7630d5e60e","observation_id":"cb323b79-50ff-480c-8f3f-c00ae34c329a","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":", η 2}, the dot product score p1,i is replicated ˆri times in the first block of p2, where ˆri are nonnegative integers satisfyingPη2 i=1 ˆri =η 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:a4ff520c67152167ac475d760b06a1c7ddbf5151332276ad1742acbfd77ee0c4","observation_id":"d50afa9f-a2d0-42ad-a1e7-4faa3360f6f2","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":", ℓ}, the entry p2,η1+i−η2 in p2 equalsp 1,i +δ i for someδ i ∈R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:47356175d7ec4b23e6b7cd26eae07d991268eacff1b3854fd19f47878b18625a","observation_id":"a9977850-c895-4943-8fe6-87ce659b43e2","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"Without loss of generality, we assume s1’s hidden states Xl 1 ∈R η1,d and s2’s hidden states Xl 2 ∈R η2,d, where η1 > η2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:25f9d8cc1fb5085124fe678150b4d3d337ee05fbb88f368a53f942d25c65af0d","observation_id":"9bc1ee54-db30-4a84-bab3-7340a6b767aa","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"Now, we need to build correlation between ˆXl 2 and Xl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:9fc73288547a68b7120b9762c577811f43c3c5ac1cc06c12a10e0c618fe97b6c","observation_id":"8ec788a2-686d-4ecf-8d56-389ead59fee9","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":"important","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:1884dcf28036068e2c62f1c46515ea12c4b925b350f7a7efd9cffc1ef40daf6c","observation_id":"0df0f422-faef-42d5-9afb-28ed16c62a59","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:37:07.868266Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:ae06917bb411ccd65420293f7a6dc8f9d2d0569a15ac15be64603b4edad7715a","observation_id":"710fa810-ac94-409c-bb64-0de3069c356f","resolution":{"observed_at":"2026-06-29T08:37:07.868266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1430.1420","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:43:15.446502Z","title":"The result is presented in Table 10","venue":null,"work_id":"1fb08115-af7a-40f1-915f-5a924a93b764","year":2025},"citing_paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:07.868266Z"},"links":{"citing_paper":"/paper/2605.29782"},"observation_digest":"sha256:c043595ca5bea27d4fbd5b09aadfc4d887693f22704a2271e14527ea9ecd184a","observation_id":"da1feee1-300c-4718-86d9-f081ce785f5b","resolution":{"observed_at":"2026-06-29T08:43:15.447991Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.29782","last_updated":"2026-05-28T11:31:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T05:44:29.740235Z","submitted_at":"2026-05-28T11:31:13Z","title":"Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":2,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2605.29782."}