{"as_of":"2026-08-18T22:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9349b4ec6f27ae8f3b033c6b48b36217a0e52f51ef425ffc08c40160c970e1a7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:05:50.935027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T00:26:48.578074Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-10T23:07:33.638201Z","title":"Enhancing decision-making for LLM agents via step-level q-value models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21154","last_updated":"2024-12-30T18:33:28Z","snapshot_observed_at":"2026-08-15T03:49:18.213082Z","submitted_at":"2024-12-30T18:33:28Z","title":"Aviary: training language agents on challenging scientific tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:33.638201Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2412.21154"},"observation_digest":"sha256:41d5c776511efa30f44fac532732f8796c707b4c262d11dbe983c0448d1743d1","observation_id":"ac43e7f8-0af6-441c-a216-30d54a835a2d","resolution":{"observed_at":"2026-08-10T23:07:33.638201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-10T18:22:02.748089Z","title":"Enhancing decision-making for llm agents via step-level q-value models.arXiv preprint arXiv:2409.09345, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.748089Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:f10b29f250927ce022c31123e974eb07a87e008f2cec5e1e1cfd303802c9a524","observation_id":"055d0052-2503-4156-b4c9-94ca80654ecb","resolution":{"observed_at":"2026-08-10T18:22:02.748089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-09T11:47:31.398270Z","title":"Enhancing decision-making for llm agents via step-level q-value models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02584","last_updated":"2025-02-04T18:58:31Z","snapshot_observed_at":"2026-08-17T20:22:24.821025Z","submitted_at":"2025-02-04T18:58:31Z","title":"QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:31.398270Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2502.02584"},"observation_digest":"sha256:d5ecc5c72622f6a341a53c8c71ebcbac0da2c666d4cd8f5a5af951f4057ba0f2","observation_id":"a2b80174-0589-444b-9c80-df89f3992d60","resolution":{"observed_at":"2026-08-09T11:47:31.398270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":"2409.09345","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2409.09345","venue":null,"work_id":"852f06ef-194b-49b9-8a01-f43edf7aafdb","year":null},"citing_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T00:26:48.291431Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2504.13958"},"observation_digest":"sha256:cfe2e7f34393040ad87154f713fbb62f503de690167da2414a8f94edad371f90","observation_id":"2f110b1a-d3c9-49e0-b9a1-cccdc5bde5d2","resolution":{"observed_at":"2026-05-14T00:26:48.581281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-15T22:05:50.935027Z","title":"arXiv preprint arXiv:2409.09345 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08189","last_updated":"2025-08-25T08:03:43Z","snapshot_observed_at":"2026-08-17T22:00:50.166582Z","submitted_at":"2025-05-13T02:58:04Z","title":"DSADF: Thinking Fast and Slow for Decision Making","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:05:50.935027Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2505.08189"},"observation_digest":"sha256:38a99819f29a2def5be05c6d799b78f8bae80195b7d0d0242f78346ebf76c46c","observation_id":"abbbeb2b-ce29-407a-843f-5a0d3db5bcaf","resolution":{"observed_at":"2026-08-15T22:05:50.935027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-06T22:36:45.285843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-17T16:47:34.509360Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.285843Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:df66d80a594c62916d3f1aa4a9278d986d4f99618fb288e9ead6fab6bcca84b6","observation_id":"72928ad8-48a3-482c-9f98-3429532b762e","resolution":{"observed_at":"2026-08-06T22:36:45.285843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.09345/citation-record","integrity":"/paper/2409.09345/integrity","json":"/paper/2409.09345/citation-record.json","paper":"/paper/2409.09345"},"outbound":[],"paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2409.09345."}