{"as_of":"2026-08-05T01:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48a8a95065d009cb0c0ec96f1128027cea36ccbb1082132887c422d4961e1f6e","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:04:09.237686Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.25556/citation-record","integrity":"/paper/2606.25556/integrity","json":"/paper/2606.25556/citation-record.json","paper":"/paper/2606.25556"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09961","last_updated":"2026-06-08T14:26:05Z","snapshot_observed_at":"2026-07-06T23:49:12.754871Z","submitted_at":"2026-06-08T14:26:05Z","title":"3SPO: State-Score-Supervised Policy Optimization for LLM Agents","version":1},"cited_work":{"arxiv_id":"2606.09961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09961","snapshot_observed_at":"2026-07-04T19:40:07.691482Z","title":"3SPO: State-Score-Supervised Policy Optimization for LLM Agents","venue":"cs.LG","work_id":"33e32d44-e693-4db2-a3dd-f61c143b7d07","year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2606.09961","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:77e7a2060fa871e84f6678e60fb182974b38dfa8649f6155cbc6ab00738294f7","observation_id":"a852350c-56eb-4c8f-a697-f7d81fee59d2","resolution":{"observed_at":"2026-07-04T19:40:07.692706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:07.708567Z","title":"Hierarchy-of-groups policy optimization for long-horizon agentic tasks","venue":null,"work_id":"2243c3bb-0bbe-4f48-8bd8-d3b02a69ed9a","year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:34a3d76a779d2bf76c17aaa37fc4906d58d0f1657c45f360a8fa63a4b68b04d0","observation_id":"78dd07e1-454d-43d5-a82c-1294cc757c56","resolution":{"observed_at":"2026-07-04T19:40:07.710290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.21563","last_updated":"2026-06-08T14:57:56Z","snapshot_observed_at":"2026-07-13T20:45:51.205893Z","submitted_at":"2026-03-23T04:35:02Z","title":"Counterfactual Credit Policy Optimization for Multi-Agent Collaboration","version":4},"cited_work":{"arxiv_id":"2603.21563","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.21563","snapshot_observed_at":"2026-07-04T19:40:07.680649Z","title":"Counterfactual Credit Policy Optimization for Multi-Agent Collaboration","venue":"cs.AI","work_id":"a8f0420b-cf1b-42fa-b6d5-5a4c1047cfc5","year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2603.21563","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:9c9cf747dbc1ee89e7b71337beadef96a341da0cb7e86518bf718b801ff9d3bf","observation_id":"d11bf8e8-69d3-4f59-9f74-c090727beb5f","resolution":{"observed_at":"2026-07-04T19:40:07.682048Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2604.19485","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19485","snapshot_observed_at":"2026-07-04T19:40:07.675000Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","venue":"cs.LG","work_id":"5b9f69d3-1980-47e7-b470-e4793b65b2ce","year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2604.19485","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:6f4993465eea2df81e73dea626e297309de6d03cc79227907514a603e8cf31ca","observation_id":"3836ffba-fb46-4ec7-9a06-ecfcd9361482","resolution":{"observed_at":"2026-07-04T19:40:07.676769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:04:09.237686Z","title":"ADaPT: As-needed decomposition and planning with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:e9806adbf186ea75c64f86b53821fb74779dc573e8a0098da7d9e209b3d463a8","observation_id":"8512bf8a-c8f5-4cb9-b9a4-09104d992594","resolution":{"observed_at":"2026-06-25T21:04:09.237686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:9d0b418ecb7a7c93141a79ab7a60d25ab7ed5ada1c54cf97deee835ffd0198ea","observation_id":"38c871c4-6484-4b15-b2c0-f7ec0c06baef","resolution":{"observed_at":"2026-07-04T19:40:07.679210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:fd56e549351d2bcec8a1da350b7fceba72731f551d384e51db6cddd0394e9f06","observation_id":"ed63e954-a7aa-44b3-bdad-2749b8b4bac1","resolution":{"observed_at":"2026-07-04T19:40:07.684520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":"2010.03768","doi":"10.1109/cvpr.2001.990517","metadata_source":"pith","pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":"cs.CL","work_id":"fa436f46-ec0a-4d2e-a0ff-e697def4a7be","year":2020},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:7428676f71f2e3472467f0eed392e93992fd2855ab84d7c20b25b869fb8c2e39","observation_id":"2d4e19af-aff9-440c-b889-168c4c22c501","resolution":{"observed_at":"2026-07-04T19:40:07.712600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08754","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:20:07.657782Z","title":"arXiv preprint arXiv:2603.08754 , year=","venue":null,"work_id":"49010963-6701-44ce-81c9-fd216914feec","year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:079926915251abf906e83b9fc74bc75d5ca8fe8d4a49224574e328c3580f35be","observation_id":"cc7153b7-09e3-4ffc-a0cb-6bf605b8d134","resolution":{"observed_at":"2026-07-04T19:40:07.707019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22338","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:07.701968Z","title":"arXiv preprint arXiv:2505.22338 , year=","venue":null,"work_id":"37e53f06-6b78-4ed5-82bd-d61ab2c1398c","year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:9000508c1ef3b3402c96a97bafd666cb3c36616d9be357390299a0f5a177765a","observation_id":"84eb6661-9c47-46ac-8675-9f5b7b1459d8","resolution":{"observed_at":"2026-07-04T19:40:07.703613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:07.694390Z","title":"Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment","venue":null,"work_id":"92210c7f-f522-47f8-9b96-564503f5dbca","year":2025},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:80a45346fffe102c80e9e44f0e6aa12e56ee29d3cd19d38a3b9110240dafcd7f","observation_id":"42f73ad9-1957-40da-a546-5dc98e4bd52c","resolution":{"observed_at":"2026-07-04T19:40:07.700720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:6a34f2297d0bda75cf0e90924df0b18a89860353f3f52d7f9c29cf3c806092ae","observation_id":"4adb449d-0218-46a0-a110-4838e5e871f2","resolution":{"observed_at":"2026-07-04T19:40:07.695197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10742","last_updated":"2021-04-07T01:57:14Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:59:35Z","title":"Learning Invariant Representations for Reinforcement Learning without Reconstruction","version":2},"cited_work":{"arxiv_id":"2006.10742","doi":"10.48550/arxiv.2006.10742","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.10742","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Learning invariant representations for reinforcement learning without reconstruction.arXiv preprint arXiv:2006.10742","venue":null,"work_id":"92ef126a-9005-43ad-9330-860508c864ca","year":2006},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2006.10742","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:0582140fbfc4535d328d1f2368bf63728179fc05400130a4f0052cb85c658ea2","observation_id":"352d998d-fff4-42ed-a36d-3956d1af82a9","resolution":{"observed_at":"2026-07-04T19:40:07.693168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:04:09.237686Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:2f8bc6baa43f4502def7781cc2ddc1760d161a12a7f5372668090000670f6943","observation_id":"89dc4a3d-182d-438f-a3b8-d4fe67dfe03c","resolution":{"observed_at":"2026-06-25T21:04:09.237686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:04:09.237686Z","title":"For each promptp we sample G trajectories τ (1),","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:41922762e1527bb84fc2accfec3c1bcf17abac62d94a199d21d85121b5808bf4","observation_id":"1f81d9b8-fd43-4ade-9871-aa0d40c06af6","resolution":{"observed_at":"2026-06-25T21:04:09.237686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:04:09.237686Z","title":"see Table I.1","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:9da2534243109a3201563b030e2b1aa7798f96b926eff0d513a967b26e91f8dd","observation_id":"16ec4b14-d23e-42c8-b276-fe726f82e4b5","resolution":{"observed_at":"2026-06-25T21:04:09.237686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:04:09.237686Z","title":"OnALFWorld,BiPACElowers the single- ton cluster fraction by 9 .3pp and increases mean group size by 1.6×","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:4b3dbaf8b45c5193b586de59e7785b3754c7f7a2c72b9cc8108182aa2f577445","observation_id":"9dc4a11c-36da-43a7-be1b-f26b391035e2","resolution":{"observed_at":"2026-06-25T21:04:09.237686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:04:09.237686Z","title":"Val/success-rate (binary aggregate, |V|=128) across three seeds: 93 .8%, 92 .2%, 94 .5%; mean ±std = 93.5±1.2% (reported as 93.5 in theAllcolumn of Table 2)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:9445262e858fc5187fcd3b72c53478432edb2b6a94eb1f6e0f8a8c7dd437b39a","observation_id":"cb74eda4-80b1-4b18-8e70-9a7bc3ceb053","resolution":{"observed_at":"2026-06-25T21:04:09.237686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2606.25556."}