{"as_of":"2026-08-01T23:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13d62e5ae4298c826dec1d0b484802c4480bd8a4a74c3888486fda3ce591a74c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T11:33:21.391661Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T19:01:21.650333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T19:07:35.241005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"cited_work":{"arxiv_id":"2604.22937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.22937","snapshot_observed_at":"2026-07-10T19:07:35.241005Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","venue":"cs.CL","work_id":"384938ff-460a-4526-9bed-b4d94b193834","year":2026},"citing_paper":{"arxiv_id":"2607.07436","last_updated":"2026-07-08T14:08:04Z","snapshot_observed_at":"2026-07-11T23:20:06.299748Z","submitted_at":"2026-07-08T14:08:04Z","title":"The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T19:01:21.650333Z"},"links":{"cited_paper":"/paper/2604.22937","citing_paper":"/paper/2607.07436"},"observation_digest":"sha256:e81cfda69385eb0f2c664c5e84b252be3e62b595609ee9bfa5454ccab9dc78eb","observation_id":"939fb746-b159-48e3-a0cc-4d79b29405b3","resolution":{"observed_at":"2026-07-10T19:07:35.244603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.22937/citation-record","integrity":"/paper/2604.22937/integrity","json":"/paper/2604.22937/citation-record.json","paper":"/paper/2604.22937"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.938856Z","title":"online\" 'onlinestring :=","venue":null,"work_id":"38c07273-5071-4bbb-b2af-067af11becc7","year":null},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:a0c75041d810b499a7a3bff0ed2947fcaa69f442f64bb38eb5763775c75e5e41","observation_id":"c46bb44e-3c1a-4045-b196-572805592936","resolution":{"observed_at":"2026-05-26T14:07:51.807847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.963345Z","title":"write newline","venue":null,"work_id":"b6ace3ad-bd44-4a95-86ee-c7b73bd4cda2","year":null},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:fa2d41029c7d29069a2485e20adb57047f16a64da645ce914eac84dfcbf73ce3","observation_id":"36aafd43-bd3d-4c22-830f-d6076901e1b1","resolution":{"observed_at":"2026-05-26T14:07:51.829409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":"2505.23281","doi":"10.48550/arxiv.2505.23281","metadata_source":"pith","pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","venue":"cs.AI","work_id":"61e8d872-ccc7-46b8-8ec1-94008704c941","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:1823ea05abedd2cbfb571bd5584332afbfb5d81d3ae3978598193554e326a686","observation_id":"44cdc814-62bf-4033-9e5f-a12af7dc4de3","resolution":{"observed_at":"2026-05-15T00:10:14.938194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:d7ff62fc1ef2e060a5c21a78a267c362254f156ccd1ed1248d97ba8c62127897","observation_id":"7407d28d-99e4-4b14-b14a-af2bcd5a30c8","resolution":{"observed_at":"2026-05-11T19:36:13.750346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13820","last_updated":"2025-07-30T14:58:42Z","snapshot_observed_at":"2026-07-06T20:39:15.111209Z","submitted_at":"2025-02-19T15:32:11Z","title":"Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning","version":3},"cited_work":{"arxiv_id":"2502.13820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13820","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"28945f99-a70f-4b93-87eb-57687f116a71","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2502.13820","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:860e7e5cf90fc3a50ca1214b2495dffd08799ca24e1edc53a5a21417aa42bb84","observation_id":"1ebfef7f-f252-4e21-aae1-29f8a5981718","resolution":{"observed_at":"2026-05-11T19:36:13.787691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a463da1e-e725-4cc5-bd81-6cdc7f54ce73","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:68b03b40cf76d4b74291f26650313a132cd55f830e18b659c62d3be7bf5052cb","observation_id":"d8ea1117-5b30-456d-8dac-147a32ff1d04","resolution":{"observed_at":"2026-05-26T14:07:51.832178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"978d67d1-582d-4053-bafe-0fac3c141380","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:7849186e3eaf3146043756d62645896f0f5a3debc0209d75bbf130bc971d1378","observation_id":"7ecbb288-1d78-4a7c-89a9-b47f84a32448","resolution":{"observed_at":"2026-05-26T14:07:51.820152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond oracle: Verifier-supervision for instruction hierarchy in reasoning and instruction-tuned llms","venue":null,"work_id":"ad84fdb6-547c-47d3-895a-001eb7c5e6fe","year":null},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:04608258c8f69d746f291c575fbe29fe3dc7b0400c926f5d38e4c27396cf7b44","observation_id":"21cfe2ab-2b31-4a46-97d2-828433491170","resolution":{"observed_at":"2026-05-26T14:07:51.813014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:1c675a92c8ecf7125c41d0e545c927944d9d3c974d1273a9f7838d9eff8cb795","observation_id":"48029d7e-f467-4632-9309-499a21e736a7","resolution":{"observed_at":"2026-05-11T19:36:13.731528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"819c1fad-02c5-42b5-a3f2-484fc18ff22f","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:e2c379544dda084f6ad9eb2e320ccf8ac3d208ff83424b37ba37a5c812c4158e","observation_id":"2ac75d33-6d5b-4bf5-b07b-3fe8b882cb8c","resolution":{"observed_at":"2026-05-26T14:07:51.835109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.16828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:40:07.881388Z","title":"Process reward models that think","venue":null,"work_id":"5eb327be-4cef-462e-8ccc-1fafa6d30e28","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:5656b5b937d6c81a8cec7038e6978c6d9856f35baf81572bc317ca71973834f6","observation_id":"45661ab3-f3cb-4ea9-a9c9-efe335a0f535","resolution":{"observed_at":"2026-05-11T19:36:13.762894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21140","last_updated":"2026-05-31T12:00:00Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T07:46:46Z","title":"How to Correctly Report LLM-as-a-Judge Evaluations","version":4},"cited_work":{"arxiv_id":"2511.21140","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.21140","snapshot_observed_at":"2026-06-29T22:04:00.693420Z","title":"arXiv preprint arXiv:2511.21140 , url=","venue":"cs.LG","work_id":"e0a5f81a-d626-4818-a040-1bfcae0f3d3d","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2511.21140","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:b7cdc3b853cdbd24daec8a0c61eb8065364905aaf884efaa28aa2b730d220969","observation_id":"f128a48d-731f-46f1-8d57-728379350875","resolution":{"observed_at":"2026-06-02T03:04:02.584259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5583765c-960d-4020-8c63-9e93d075539e","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:ae4c629f2fc519dd630928fd7b02913f851cb89fce8271f0183243b13a65850e","observation_id":"e763ad97-8017-4944-a0c3-90190430f9c1","resolution":{"observed_at":"2026-05-26T14:07:51.815193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:17:10.144588Z","title":"LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge","venue":null,"work_id":"bd49bdd6-b2b5-4c7e-ad0d-cc07261f2b50","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:af71d843fc3eca537b665ca4dec2d33c05eee8eeae79a9aa82a1ee110d0d0017","observation_id":"ec19ef6e-2772-44da-aae4-b49188f278c2","resolution":{"observed_at":"2026-05-11T19:36:13.714408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbe53250-0af9-4ae2-ab4f-d60120e94e60","year":2023},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:453d848edfdad94f24da3edcf91f5fec1038ad038b6c3f161af709087bc5f876","observation_id":"8ad72153-e9aa-4dd1-a290-1e3c637781a2","resolution":{"observed_at":"2026-05-26T14:07:51.805284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03329","doi":"10.48550/arxiv.2603.03329","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Autoharness: improving llm agents by automatically synthesizing a code harness","venue":null,"work_id":"319cc429-04ff-4365-ab39-84cffbfeef55","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:38332efa3fb9c700285e2ff13c6b23580d3552af82e536654bb485b1652e883c","observation_id":"768b5491-8865-4ee8-963c-b45f37ef4ee0","resolution":{"observed_at":"2026-05-11T19:36:13.775751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f736b47a-310a-43b1-b33a-4d5445382ba7","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:b33ae5429afe40b95be623e3a4520a46d7f6d9056731ef280c63785841be9814","observation_id":"a75a7856-c5f8-409c-b872-eaec0a77c1f8","resolution":{"observed_at":"2026-05-26T14:07:51.799298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5655666b-2d87-4e09-8ca6-fff826718840","year":2023},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:5aebc67ddc8c52f3fbae83fcfc6a108bf6f5749cc17b7a0b3eb9a49308dd30fc","observation_id":"3a597ab0-7276-4732-b31c-d285b5cfc3a8","resolution":{"observed_at":"2026-05-26T14:07:51.810638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25723","last_updated":"2026-05-18T07:29:29Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T17:58:15Z","title":"Natural-Language Agent Harnesses","version":2},"cited_work":{"arxiv_id":"2603.25723","doi":"10.48550/arxiv.2603.25723","metadata_source":"pith","pith_arxiv_id":"2603.25723","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Natural-Language Agent Harnesses","venue":"cs.CL","work_id":"9756d161-8a6c-4ba3-8bf8-3af1f9e911d3","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2603.25723","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:ec91e65d62026cee760dc6f5f4cfe00cecc86fa2c8d9b6c30b8351d1059101a3","observation_id":"91b8ae1e-4a0e-402a-a76c-98d6d5cb03de","resolution":{"observed_at":"2026-05-20T00:04:30.082400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"602ebfa4-7573-42e4-aff0-f42d25bd9078","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:b3a9bda1d97b525a08e8f701367f0998b53e98ff29da86f6bf3c1472cac73dcd","observation_id":"89ed779a-d700-45f5-963a-a3e25281d343","resolution":{"observed_at":"2026-05-26T14:07:51.822974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.17223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond outcome verification: Verifiable process reward models for structured reasoning.arXiv preprint arXiv:2601.17223","venue":null,"work_id":"af5e19ae-3ee2-463b-b2e4-ff7a6975cea5","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:c8ec85e0df97a2301791f800d07af5d70f48141132c2dce74c383230d257af65","observation_id":"67002705-f036-44ce-95a4-3a7e5675ba47","resolution":{"observed_at":"2026-05-11T19:36:13.725542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:0417cff4f2a8acabb374c0f9b51c07dac43c98fb9835333a06d584e6ed90ed27","observation_id":"bc17e442-b7b8-4bf7-a2e3-e26fa3ebcc59","resolution":{"observed_at":"2026-05-11T19:36:13.699446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T02:17:46.480513Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:ceace05a8b40046b57af80784f7ecc375e9496eea3f24bf213ba7119f10e84c1","observation_id":"85b937d4-e414-4c45-83ff-e793b734385e","resolution":{"observed_at":"2026-05-11T19:36:13.679536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:25.151918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:25.151918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:747c5c23bf3f11e8602989c2387a9b734851c65dd4a1793395543c0c83f6b335","observation_id":"119e44ff-95f2-4253-a83a-9b506b9a545c","resolution":{"observed_at":"2026-05-11T19:36:13.660771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21117","doi":"10.48550/arxiv.2509.21117","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Trust- judge: Inconsistencies of LLM-as-a-judge and how to alleviate them.arXiv preprint arXiv:2509.21117,","venue":null,"work_id":"10d40448-0d0f-4f32-bc22-b2d999802f0d","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:2ebc6029316a912059dada6c9ae0b75a6ba35d5c9077ec135e0be9311cc7a9d7","observation_id":"145e1f44-a3ec-43c5-a78b-146fd6307c3c","resolution":{"observed_at":"2026-05-11T19:36:13.649003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3e198d5b-dae1-429c-9cbb-2b6b49ab7f6b","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:75d3f8423880579362aa05648685abcd75a69da3dc655e01c77e15ad41a48276","observation_id":"51f8e7e6-b35a-42e7-a489-d3107768fd20","resolution":{"observed_at":"2026-05-26T14:07:51.826464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20139","last_updated":"2026-04-02T18:48:19Z","snapshot_observed_at":"2026-07-06T21:30:42.185904Z","submitted_at":"2025-05-26T15:40:42Z","title":"StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs","version":3},"cited_work":{"arxiv_id":"2505.20139","doi":"10.48550/arxiv.2505.20139","metadata_source":"pith","pith_arxiv_id":"2505.20139","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs","venue":"cs.SE","work_id":"78664cfd-b836-422c-9d6f-6566cddaead9","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2505.20139","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:71aaa0dc7fa978c7aae7cf95483460799eb6ce305efa26bc8b81e0cd48779d7b","observation_id":"1017f8af-d607-4e1b-b968-50192fc8f6da","resolution":{"observed_at":"2026-05-11T19:36:13.704509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8bfa50b8-478e-4a1a-9803-922a9118f0a7","year":2022},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:947810363fe9e2509102fabefd1f64e00c4a559c8e48a27550a93c841edd32f8","observation_id":"7875a516-346b-4f3a-8e20-5c64e9321aca","resolution":{"observed_at":"2026-05-26T14:07:51.802944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02474","last_updated":"2026-05-24T19:01:09Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T18:53:28Z","title":"MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents","version":2},"cited_work":{"arxiv_id":"2602.02474","doi":"10.48550/arxiv.2602.02474","metadata_source":"pith","pith_arxiv_id":"2602.02474","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents","venue":"cs.CL","work_id":"64baa7f3-849b-485e-b081-2074d82f1364","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2602.02474","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:1915defc4319429bf55726019219720b0869c56635c7a94cbb989bcd1c4cb832","observation_id":"099524b1-63dd-425c-b722-87a3f0b40fdd","resolution":{"observed_at":"2026-05-12T09:10:22.017517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16004","last_updated":"2026-04-17T12:27:36Z","snapshot_observed_at":"2026-07-06T23:03:26.308324Z","submitted_at":"2026-04-17T12:27:36Z","title":"AgentV-RL: Scaling Reward Modeling with Agentic Verifier","version":1},"cited_work":{"arxiv_id":"2604.16004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16004","snapshot_observed_at":"2026-07-04T20:20:07.663758Z","title":"AgentV-RL: Scaling Reward Modeling with Agentic Verifier","venue":"cs.CL","work_id":"bba2b44a-06ba-4a37-95fc-5e5ede30502d","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2604.16004","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:df6b11597e1bd1f8be61a6748285897af48640c76ed7456ea0e2f7aba86fe343","observation_id":"92666ef6-494a-4a0a-be5b-9eb7e62098bd","resolution":{"observed_at":"2026-05-11T19:36:13.694509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04618","last_updated":"2026-03-29T09:18:02Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T09:30:18Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","version":3},"cited_work":{"arxiv_id":"2510.04618","doi":"10.48550/arxiv.2510.04618","metadata_source":"pith","pith_arxiv_id":"2510.04618","snapshot_observed_at":"2026-07-10T16:57:24.542956Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","venue":"cs.LG","work_id":"c1d09cf9-9176-403d-8028-630bbc0cbc5d","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2510.04618","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:ada3cb0e74ca3cbfeae53bd2dfc397c25135503944258e1077da9b2c0bb6bd91","observation_id":"fd5e532e-81b4-4da3-aca3-7a62b4d7a490","resolution":{"observed_at":"2026-05-12T16:44:08.223014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"777dca04-8f82-42e5-8abd-6c3bca685110","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:0fb7f98f4219f6b7668250e8cef5ec9bf7d35666ab57c67ac80d0cbad6605fc2","observation_id":"00d1a3ea-39d5-4299-b112-6b2d5ca445a7","resolution":{"observed_at":"2026-05-26T14:07:51.817477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:14:22.186862Z","title":"Available: https://arxiv.org/abs/2603.11445","venue":null,"work_id":"84a15383-b86e-4bed-9fc0-6c8f700b9f3e","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:63d5c9f2666abe581c5bf9e4c0b6b9f736e323da9fdffbbc110a4abaf85e722d","observation_id":"f3f8c785-c41e-426c-b7d3-cbd8aa881af9","resolution":{"observed_at":"2026-05-11T19:36:13.668075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10132","last_updated":"2025-01-17T11:41:53Z","snapshot_observed_at":"2026-07-06T20:22:23.609336Z","submitted_at":"2025-01-17T11:41:53Z","title":"ComplexFuncBench: Exploring Multi-Step and Constrained Function Calling under Long-Context Scenario","version":1},"cited_work":{"arxiv_id":"2501.10132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10132","snapshot_observed_at":"2026-06-29T13:13:27.295521Z","title":"ComplexFuncBench: Exploring multi-step and constrained function calling under long-context scenario","venue":null,"work_id":"032fd075-966f-46cd-b9f4-8b03ac993484","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2501.10132","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:b965e03a9f5ba9510323da3f89f9877b6ad4dabb3d5992b6026676365d479966","observation_id":"c90841e7-ff2f-4029-b6d1-7a368a59c826","resolution":{"observed_at":"2026-05-11T19:36:13.672811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":20,"verified_fuzzy":3},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2604.22937."}