{"as_of":"2026-08-08T20:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83d386919056cad53f390de902e7c83df255544635bd4d814fbcd59da380cba8","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:54:59.746921Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16244/citation-record","integrity":"/paper/2607.16244/integrity","json":"/paper/2607.16244/citation-record.json","paper":"/paper/2607.16244"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.689558Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.689558Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:82c0ccdfb78e443f0ec903995b831aca0e32a307311a4c647c02211dc6d623c5","observation_id":"5e0b9589-1f5e-44e7-8682-293f282d0988","resolution":{"observed_at":"2026-08-02T09:54:59.689558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.693155Z","title":"Schick, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.693155Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:ba64286c9afc56d84275b56e47a9dc1a65e19b6e8e25af85f45d7337c3300cf6","observation_id":"db367e31-9f41-4189-bada-733e1322f6ca","resolution":{"observed_at":"2026-08-02T09:54:59.693155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.696347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.696347Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:e087183464d41cad4257e638a8c067a56ec13bd0e7c0b3938dc7f5fa9ddc18b1","observation_id":"4672ff76-e36b-4238-a1e1-0b0495f3ab47","resolution":{"observed_at":"2026-08-02T09:54:59.696347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T09:54:59.699456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.699456Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:31aea68bc1940f138a7fc96918cbb567f2d2ae01bf99e642c431bf57cf6480f8","observation_id":"75e56848-1979-4508-9fbf-5a5d0d4bffe5","resolution":{"observed_at":"2026-08-02T09:54:59.699456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.703091Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.703091Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:ccde90b26ca44bfdc74799091735ae1112855561c6e9cebf3f572f3fec48108d","observation_id":"44f81821-1a5c-45ed-8553-912ea605aed1","resolution":{"observed_at":"2026-08-02T09:54:59.703091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.706062Z","title":"Rafailov, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.706062Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:af544b5633bfd00a940a35e2bf77c58d6321bead4b54cdb7d4e236f700cce562","observation_id":"abb30e47-1b4c-44e4-82f1-4a28994bb51c","resolution":{"observed_at":"2026-08-02T09:54:59.706062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T09:54:59.709186Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.709186Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:02b8ee824b0d79ba4bdf7ee80cb56e189335bc6c0dbe274153bcc3de1f7e5a34","observation_id":"659ec3d1-7201-433a-b62f-2ed733b1d086","resolution":{"observed_at":"2026-08-02T09:54:59.709186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.712093Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.712093Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:be719516448a3e8bc14ac0e71a738f512af7472525264316ee469aa24dbc728f","observation_id":"de019db1-0a0f-422d-b629-52f4bc057c23","resolution":{"observed_at":"2026-08-02T09:54:59.712093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-02T09:54:59.714807Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.714807Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:8f35257523aea0b7e7e9e760e8c5a2ea72c4fdd1ef5b40f33baab81ca02f5980","observation_id":"b8bf6993-3480-4d9c-a108-19cd85ad1cba","resolution":{"observed_at":"2026-08-02T09:54:59.714807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T09:54:59.717442Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.717442Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:e86ef4a57d53370bcffa2e24f35be84020b3069b0508847901500b30dbd35275","observation_id":"accb0374-4555-4dca-9f11-d210c81d3cff","resolution":{"observed_at":"2026-08-02T09:54:59.717442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-02T09:54:59.720373Z","title":"Putta, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.720373Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:24cc03b7f82906c4e37f94f93d1db5614715d5a141e1c53f16f9973691c11af8","observation_id":"9748dc5f-43b2-431b-ab4f-bfdb972010e8","resolution":{"observed_at":"2026-08-02T09:54:59.720373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08747","last_updated":"2024-10-31T03:16:13Z","snapshot_observed_at":"2026-07-06T18:30:02.349638Z","submitted_at":"2024-06-13T02:08:28Z","title":"StreamBench: Towards Benchmarking Continuous Improvement of Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08747","snapshot_observed_at":"2026-08-02T09:54:59.723295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.723295Z"},"links":{"cited_paper":"/paper/2406.08747","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:d22e778812c605a556311eed590878348278360f55dbedd18cadbea918f15e31","observation_id":"8552f231-b64f-4184-9694-153af1263a8d","resolution":{"observed_at":"2026-08-02T09:54:59.723295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-02T09:54:59.726132Z","title":"Zhang, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.726132Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:e34d32fb1dbd29df0a73ab50d083cafb95216a4ac0198506bc0fb179f23d5933","observation_id":"02923fb9-c267-4ac0-a44d-b3571225cc57","resolution":{"observed_at":"2026-08-02T09:54:59.726132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.728846Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.728846Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:de54a1e2c182076eaf823fb5dbfcdc41de69540f4ece10248abc6ce140c187a2","observation_id":"f529a08d-8637-4fc6-be9b-458095dbcc92","resolution":{"observed_at":"2026-08-02T09:54:59.728846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.731287Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.731287Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:095f342724e0d7c17d52a9e2f13b7624d9c0c7dcf237192941ece2b0143baa71","observation_id":"51e8a000-867c-462d-90a2-f9db3743f27e","resolution":{"observed_at":"2026-08-02T09:54:59.731287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.733880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.733880Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:4b2554db1f8f4dd57d62b7d9e68897f0ab0bc57e451d28d8022c80f173ca064b","observation_id":"d5212ec2-4803-4c08-9810-4956e9292443","resolution":{"observed_at":"2026-08-02T09:54:59.733880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-02T09:54:59.736381Z","title":"Lightman, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.736381Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:ae25d29cfcc69752228a9f531633fe1f5146e2a90b855ce39c080d7b0964b4b0","observation_id":"22492163-c967-48bf-8ba8-a027a37bf2e3","resolution":{"observed_at":"2026-08-02T09:54:59.736381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.739036Z","title":null,"venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.739036Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:fe6ec55083fd1b68102874568667130a47bd6c568547be49b4e21c316225340a","observation_id":"c161a161-aac7-445d-8093-545ac2ec425e","resolution":{"observed_at":"2026-08-02T09:54:59.739036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.741613Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.741613Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:0dfd2919a0257133949e5e5792569bdefa84cf672336966e7eef2eb7dd4ad854","observation_id":"593bcd20-98f7-43bd-999b-8e8ed13b62f7","resolution":{"observed_at":"2026-08-02T09:54:59.741613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T09:54:59.743987Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.743987Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:76e9a101794a8cf139e2edfeefb680d45bd44ebfaa5db38f618d17145429891a","observation_id":"5349ea33-a3eb-4837-8369-78b6053284fa","resolution":{"observed_at":"2026-08-02T09:54:59.743987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:54:59.746921Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.746921Z"},"links":{"citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:9ba0356b05c14e87500c6e937a83e92288df8723e35f210d6621fbc15fd1b332","observation_id":"9a489e9c-d9a7-4688-a9e7-61b1b381a3d3","resolution":{"observed_at":"2026-08-02T09:54:59.746921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.16244."}