{"as_of":"2026-08-18T13:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb9fae4b4c4ede1d712da1efb7b15e56c4461096080fa776f6bbf84b75a21c80","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:08:13.270416Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.19547/citation-record","integrity":"/paper/2411.19547/integrity","json":"/paper/2411.19547/citation-record.json","paper":"/paper/2411.19547"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-12T10:08:13.103779Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.103779Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:d087f26098bc1d87da99e2a4ecc74c57047f7462e46f8e15755b9815283fc652","observation_id":"b0164537-341b-4af9-9018-a9ad87aa6898","resolution":{"observed_at":"2026-08-12T10:08:13.103779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-16T14:53:43.494263Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-12T10:08:13.110427Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.110427Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:c57d3d00b07cce6cca112571b28deb4579f3859ab15e393a75347becb89d771f","observation_id":"3911caca-315b-48dc-ab0f-151a45476f58","resolution":{"observed_at":"2026-08-12T10:08:13.110427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-12T10:08:13.115910Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.115910Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:0dcf61b57a3f5bb4c017fb94e6ae44889735275860ab2334ade3057f85d94d76","observation_id":"ef04eb93-7dd7-4bca-bd77-6e1efd7c23fd","resolution":{"observed_at":"2026-08-12T10:08:13.115910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12881","last_updated":"2024-03-19T16:26:10Z","snapshot_observed_at":"2026-08-16T14:08:19.460947Z","submitted_at":"2024-03-19T16:26:10Z","title":"Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12881","snapshot_observed_at":"2026-08-12T10:08:13.122617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.122617Z"},"links":{"cited_paper":"/paper/2403.12881","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:3b098623b86ad0b112eda1cc6537ebc3ee43fece64c46efdd6a9ee9824b89ccb","observation_id":"6f793bbd-7632-4028-b1b5-75ba93f4de6d","resolution":{"observed_at":"2026-08-12T10:08:13.122617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.761569Z","title":null,"venue":null,"work_id":"c2487fa3-012d-4520-befe-8aeadb9d0188","year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.128743Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:b83d8989acd751588d2d9a6d57684c7cbad00f411858c67eac90232e869aac10","observation_id":"28587567-42b0-4924-987c-a60391b68760","resolution":{"observed_at":"2026-08-12T10:08:13.766325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12856","last_updated":"2024-02-25T16:17:43Z","snapshot_observed_at":"2026-08-14T05:33:25.547274Z","submitted_at":"2023-07-24T14:56:30Z","title":"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12856","snapshot_observed_at":"2026-08-12T10:08:13.133623Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.133623Z"},"links":{"cited_paper":"/paper/2307.12856","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:794434d497b1b34cce1af88186015ee76b587f9390857b615200ee169276d422","observation_id":"718e2d56-b39d-4f36-be58-647422554ef5","resolution":{"observed_at":"2026-08-12T10:08:13.133623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-12T10:08:13.139576Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.139576Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:7ad9922e13e35a9f503ed85b535eb28eeae159f94e9b9b8e5836fcee65f44b68","observation_id":"db37de30-47ce-433c-a044-113fc4eb932f","resolution":{"observed_at":"2026-08-12T10:08:13.139576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02907","last_updated":"2023-06-05T14:12:46Z","snapshot_observed_at":"2026-08-18T05:17:30.297940Z","submitted_at":"2023-06-05T14:12:46Z","title":"SelfEvolve: A Code Evolution Framework via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02907","snapshot_observed_at":"2026-08-12T10:08:13.144370Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.144370Z"},"links":{"cited_paper":"/paper/2306.02907","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:4fba5a81ffefb88a426a86898a9dca43fe952f38a826570819c6386039454e00","observation_id":"4d8aa783-376a-4892-b90d-fe4e86b880c8","resolution":{"observed_at":"2026-08-12T10:08:13.144370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.746463Z","title":"Self-training language models in arithmetic reasoning","venue":null,"work_id":"2631a3f4-bdd3-42ca-a135-4f469d01d241","year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.149088Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:63fd575aec3fa6c9adecc32be48535ed46bb8fe02c375a3ce9005a6998898feb","observation_id":"9fd38620-f1e9-4e65-b8e7-b22ecbfcf6a4","resolution":{"observed_at":"2026-08-12T10:08:13.751304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.729765Z","title":null,"venue":null,"work_id":"6a051dff-9aab-4b88-a74e-d1ce469e28f8","year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.154116Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:507fe611b235347c4c738b43c5a77d643cf15b0750457a20d9bda907e41f4698","observation_id":"8b844dc2-c8b8-4dc0-9edb-81bc36c5c626","resolution":{"observed_at":"2026-08-12T10:08:13.734739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-08-16T14:27:12.827551Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-08-12T10:08:13.158944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.158944Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:4c5efdfeef7aa49b1cac8e8a3e2b7894ac4af9fb9df03e458020beddf1cfea55","observation_id":"28d9802b-9719-4342-a050-5e0f7222eac1","resolution":{"observed_at":"2026-08-12T10:08:13.158944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.164434Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.164434Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:da67cf8b75d7110472da22b730978b81efba3088a3c270e53d16fe6cc0796581","observation_id":"7d6a8eb0-7b47-468f-a64e-8bce11b4c6ed","resolution":{"observed_at":"2026-08-12T10:08:13.164434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-12T10:08:13.169686Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.169686Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:f39c467a21bdd920941e223961670b7611c11541361b46776ad1329f29a0c6cf","observation_id":"b8711026-5546-4613-a603-0378ef86e67a","resolution":{"observed_at":"2026-08-12T10:08:13.169686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.175010Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.175010Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:39e3dbeaf5d0578521802c54afc79198548192be55fcf39c1361a88341d7b8b5","observation_id":"22770d27-8490-46bf-b7e4-ddb966e6a351","resolution":{"observed_at":"2026-08-12T10:08:13.175010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-14T14:07:14.900729Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-12T10:08:13.179868Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.179868Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:ecdc891c984c1569b56cab66eced01a4c1d8e5613b8c85141b8439a11ffa2556","observation_id":"fc839b6f-707d-4c4d-b329-ff278a5b0229","resolution":{"observed_at":"2026-08-12T10:08:13.179868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.184620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.184620Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:5e985733fef3477eaa525e7949b4b392ad189e29b71754faee08d3a93bac41e0","observation_id":"8342b52c-e514-4a8a-9361-2ac05e32dcba","resolution":{"observed_at":"2026-08-12T10:08:13.184620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.189463Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.189463Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:8774e575b89c797f29c0a6622d4fda7df7a302b80d8a3b98c759081bdc0e6643","observation_id":"464f3854-a11b-4c8a-9b4f-92286fd17e73","resolution":{"observed_at":"2026-08-12T10:08:13.189463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-12T10:08:13.194394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.194394Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:e9a4b9a0737d8408ec79c069f6f425267014c36d465ae0a57959de8fd8759e0f","observation_id":"3e5d3a35-5ba9-467f-afd8-0d04ad5bd38a","resolution":{"observed_at":"2026-08-12T10:08:13.194394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.199373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.199373Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:876cdf69e866125c1659f1f9c7296523ee3b759a68bd813a938c8857b34c4f3e","observation_id":"93d9b338-0bdf-4cd7-ae47-22bb95f431e7","resolution":{"observed_at":"2026-08-12T10:08:13.199373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.204838Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.204838Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:9f972f932ea9d7abf2464e535ac319f7966608dfd1c576d5c3defa54d672cec3","observation_id":"ca4bf90c-b752-47e8-ab71-18f14afc5c18","resolution":{"observed_at":"2026-08-12T10:08:13.204838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-08-18T05:31:28.924191Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-12T10:08:13.209522Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.209522Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:1ad5d227dd1fb2b0e161d2ee7d37b818c0de8f6965fea39ee78d5e005c8fc8df","observation_id":"30f9efe6-4235-41ab-80fe-fae95410b525","resolution":{"observed_at":"2026-08-12T10:08:13.209522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T10:08:13.214607Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.214607Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:fca8998da6472e07ead9f4f8962e31372040f7a826b85a92c23394ee43b9fdb9","observation_id":"961843a0-f1d2-4a48-a538-4833fad57d09","resolution":{"observed_at":"2026-08-12T10:08:13.214607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T10:08:13.219817Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.219817Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:28332ca50536b5f6462fad540368ffac20eda3a15229c0308cf2a405eff09e4b","observation_id":"10a9cc14-2510-4922-9bd9-38ad76b28956","resolution":{"observed_at":"2026-08-12T10:08:13.219817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.657804Z","title":null,"venue":null,"work_id":"65a38c7f-7288-4c97-bf5a-98eeb02643ea","year":2019},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.225241Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:bbe7530a98d7952d9fd578e48c1e40dedd71e07215a466c0a9b4414450f89d0e","observation_id":"d4bca0c1-da40-4e88-a251-c4d224b5cad8","resolution":{"observed_at":"2026-08-12T10:08:13.662093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-12T10:08:13.230991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.230991Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:5c7cf54ef05d82abcb8191e745f304c9f6ec25b83ca4596b7f48f6f8eaef8123","observation_id":"9ee9c83f-1709-4c35-82f4-122a2c3981aa","resolution":{"observed_at":"2026-08-12T10:08:13.230991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-17T06:15:32.510873Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-12T10:08:13.235856Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.235856Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:fbf0d5711eba471b20ac20404f759ba78d47e6cc7baff7ef866a04c3b53c3cca","observation_id":"66349724-564e-4ced-804f-1e789f21684b","resolution":{"observed_at":"2026-08-12T10:08:13.235856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06830","last_updated":"2024-08-24T21:30:00Z","snapshot_observed_at":"2026-08-16T14:53:21.281239Z","submitted_at":"2023-10-10T17:57:45Z","title":"Lemur: Harmonizing Natural Language and Code for Language Agents","version":2},"cited_work":{"arxiv_id":"2310.06830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06830","snapshot_observed_at":"2026-08-12T10:08:13.373712Z","title":"Lemur: Harmonizing Natural Language and Code for Language Agents","venue":"cs.CL","work_id":"d52026d2-e016-49e8-9e7a-31f49abd7510","year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.240119Z"},"links":{"cited_paper":"/paper/2310.06830","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:96a7b18c749a440f03cf182974a08b6ed142c2b52b14c7b479029b811b9af611","observation_id":"c40f4bc0-521e-4a6c-aaa8-3033dc969e04","resolution":{"observed_at":"2026-08-12T10:08:13.380613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-12T10:08:13.244892Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.244892Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:320d14aeda6972509ad2566b255e0ee472ee82c855d7bac72d2d3b1122e34a44","observation_id":"56c74e4a-5805-45d7-af8c-af24eb062a9e","resolution":{"observed_at":"2026-08-12T10:08:13.244892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-12T10:08:13.249386Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.249386Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:bb7dbe7d51a8f8df56b1a323548cb186069bb360a1a412a583e4f4ea8e7ec1b9","observation_id":"2894738e-c67c-4bff-8d49-7d942bb8df60","resolution":{"observed_at":"2026-08-12T10:08:13.249386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-18T11:07:04.869605Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-12T10:08:13.254686Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.254686Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:ed3ad37978ceca7f96721d9ab9b4e1bbaba1b7242d0b2ffc361129bdec51b934","observation_id":"8030f6ea-7901-4745-9615-cce2475dd0d9","resolution":{"observed_at":"2026-08-12T10:08:13.254686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17574","last_updated":"2024-06-06T18:40:47Z","snapshot_observed_at":"2026-08-18T10:03:20.539248Z","submitted_at":"2024-02-27T15:09:20Z","title":"Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17574","snapshot_observed_at":"2026-08-12T10:08:13.259699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.259699Z"},"links":{"cited_paper":"/paper/2402.17574","citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:08868d9c925cd450bdfcbd15d1a15888571787d272f2cf08f243715bc62c0cce","observation_id":"af16f172-6a01-4b14-89ea-2613ee381586","resolution":{"observed_at":"2026-08-12T10:08:13.259699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.264817Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.264817Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:3602806a2b7a3d61d98749277d6c53ecbcf118a655de1658c659bcddd5348622","observation_id":"2395cfca-8a4e-477b-8f87-0948d7c215ed","resolution":{"observed_at":"2026-08-12T10:08:13.264817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:08:13.270416Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T10:08:13.270416Z"},"links":{"citing_paper":"/paper/2411.19547"},"observation_digest":"sha256:6a518997d2e1285043554831c81806ed4b5c9ce85c420e9cdeb0ad77d16a235c","observation_id":"159d06ae-b93f-4975-ad0e-a008cba38128","resolution":{"observed_at":"2026-08-12T10:08:13.270416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.19547","last_updated":"2024-11-29T08:47:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T10:05:26.260953Z","submitted_at":"2024-11-29T08:47:04Z","title":"Training Agents with Weakly Supervised Feedback from Large Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2411.19547."}