{"as_of":"2026-08-06T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9c7dfcf1ef8a18a9bb5a22bb9a4586e43748037d479c5e2a2e8535a41c572c8","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T06:51:44.867838Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.13598/citation-record","integrity":"/paper/2606.13598/integrity","json":"/paper/2606.13598/citation-record.json","paper":"/paper/2606.13598"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:f7265e8bac64454fca897028d4fd31819a5beeb1e930497ba64117eb90682c30","observation_id":"d64303c7-5260-41a2-a018-4e29fe39d279","resolution":{"observed_at":"2026-07-03T14:58:32.596431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"American Invitational Mathematics Examination","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:48632240317e8a2efa79cc5a9d73e6b74b6c26b35b58bbe18de15fee1d6a878e","observation_id":"5627f20c-3b48-4e3a-9e7a-bdc55266c7b5","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:1d9a3d9a181c18fe1fd738f14ffbe4454481a5d086e00990a02abd8cfa9aa643","observation_id":"51184580-41a3-4c66-9d96-d34f63fbbd19","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Equipping agents for the real world with agent skills","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:717cf72f5d5f122549e62c379f8ad041b0e329418f100245d359ded98f7ee2f8","observation_id":"f69f6ad7-3e56-4cd7-9a14-966200615d4c","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:88853d7ba447cc7a48fb797c135502f981421e538c1b9ccb544255791414b0ed","observation_id":"826f1570-6c61-4569-98e8-afd40d8bcde5","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:e37070457907668a9aac6f4257c88b4a9b5d1ee35587dd59b2676b2b0a29415d","observation_id":"d81677a1-dc55-4ae2-a215-305acb05b1e0","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Openai gpt-5 system card, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:21171e5cdecd603d8478aa1a8c29dcda46f0c83e297012ac0f1084f3098df55d","observation_id":"13580ea6-9c66-470a-a61e-4c3a2a9bb2ba","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:7000cbb826fede00e4ff0ef36a6ac7812c0a973859ecad2e19ef4596208f0674","observation_id":"6a87fd69-f97b-4da3-b84a-92d4cc09416a","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:ac5f89bcc296f751b46fae85ec780f8c8599cb5df937c652c1921f744a578410","observation_id":"6fb378b2-5d97-42bf-80f4-1d29818e6b4b","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:c0ef28aeda12156fee897e22ca5dd5a47703f0922508efb7b0dc46044da46c04","observation_id":"d7ebc6af-96d9-46d8-b89c-47d7e9314674","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Kumar, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:32ef182460c581b6d84a6f94d7a879d1189f83547ffe197d9d8e61303797c296","observation_id":"ee601832-1461-4015-ad9d-d1ed6c84c5c9","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":"2410.18451","doi":"10.48550/arxiv.2410.18451","metadata_source":"pith","pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","venue":"cs.AI","work_id":"141992ea-4174-463c-be4a-add6252bde93","year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:4b102df7ce5987d2737a54d05e73329c9b28e971a784805c9d79d01e5b11e6c9","observation_id":"3a6eb111-9a70-41fa-8bb6-620b267a0833","resolution":{"observed_at":"2026-07-03T14:58:32.588394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01352","last_updated":"2026-03-02T20:56:17Z","snapshot_observed_at":"2026-08-04T07:18:25.941807Z","submitted_at":"2025-07-02T04:40:29Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","version":3},"cited_work":{"arxiv_id":"2507.01352","doi":"10.48550/arxiv.2507.01352","metadata_source":"pith","pith_arxiv_id":"2507.01352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","venue":"cs.CL","work_id":"c44139eb-e611-43d2-80db-eaecb038fe32","year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"cited_paper":"/paper/2507.01352","citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:f35ee3a16aa351a577e27dc0d7acbd611f4402976a3f7fff01c38947a519eaf8","observation_id":"6159e022-c83e-4868-b96e-c78e50b03ae4","resolution":{"observed_at":"2026-07-03T14:58:32.593893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:5825365d7c572544414c82f490a7730396f2907b2e458f9abeca3daa197bf11c","observation_id":"82401ae5-37c9-47a6-a854-6224edb6786d","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Madaan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:9e99387eb1baaadd9bd8b7d7491af396f11bd59f750a542a44b482aa8c4dd091","observation_id":"585cd0ed-2034-457b-9df9-cec0e3bfbff5","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:b44946c56a49770dc06b8359ee19897ff23fe0735130735f2d9f897685c960eb","observation_id":"34515e5f-f657-4b78-a662-9f15aecb40ff","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Openai gpt-4.1 nano model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:c011fff8a786a2ab1f227e8dc717d25204ac950a7add4ca28bb62890a43fed1f","observation_id":"6d678d9a-62e0-417a-9bf2-7e28dec04977","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:801d66022c87b05e5f8848ba850b31ba098a3ecaa91cba806453cd908754be94","observation_id":"9aa99030-df69-4387-894c-ea138e35a190","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:d9037c5f6fa119258fc3da8c5a26fa5933fefdf586ce3b13f7fa9f37855a8f54","observation_id":"d4f31c8c-c242-402c-a976-3c833f2247ed","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Rafailov, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:7cfeecf39abd78aaad7759fd148fae962147359105c2d498e35dd7e1dba3ef6d","observation_id":"32636243-c19d-4421-a855-4c286add6574","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:46dec57d43f97cf090b61582728990fd7bd35d5a80d98346f91153cad9990d8b","observation_id":"8ff886ff-fd4a-41a9-b678-401a23fb6c93","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:b67b506d3bcc849a87edf6811dbd6683e0142cb26f918cc2e32eb527dd5c509a","observation_id":"d32f7390-142c-44f2-b339-7021b5f4f87c","resolution":{"observed_at":"2026-07-03T14:58:32.589138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:d91e88241fd2ebe76c335fa28d6f9a8bed34219cbe8f4cf8fb05406d71def09e","observation_id":"d35f8c83-0c09-4a7b-97f3-e7b1795c5c3d","resolution":{"observed_at":"2026-07-03T14:58:32.591392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:a448d976d33561355f14791ec62049a2df4327d03a7d8f97bd0e07aaae785e29","observation_id":"126c3931-f9c1-44ad-9bc6-2e51232ab4a1","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Venkataramani, H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:7f7040fa1ebf63a6e3af453b5bc13f2e075af65b5e630e589fd482abc3929115","observation_id":"8946d3e5-ea9e-4dd0-a662-7a5b4179073c","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:3c556abc85b237e335b94ecb584a330d64897f83cfe0961375a5b372845b7df8","observation_id":"33f686b0-3e97-464b-9266-81de93a04e0e","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:ed6a9dd0bba69a87dcb52b92aa2de7be5e42979dbaf5eca2f19a09ff555a69ad","observation_id":"d5bb0811-54af-4424-b445-9b484c8fd85b","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":"2309.07864","doi":"10.1186/s12912-025-04245-9","metadata_source":"pith","pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","venue":"cs.AI","work_id":"985ca219-7e34-4c4f-bdc5-ccd39763ad61","year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:fc43ff66ba411693c8c54aa9d70dfadea28a4bb31978fa0ddcedf24a99211db1","observation_id":"d9bde9af-5c27-466e-b6d4-0da8ee0b97d0","resolution":{"observed_at":"2026-07-03T14:58:32.583531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:89e69cc4a1b3eb2b3479de13be1fc6fc0b70430355c773dae26ce8037e731912","observation_id":"bff47de2-4e3c-4e36-8bac-b94d433589f4","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:70ba98701b18f338f7c83c7d2c94ae9b503929119b29fb2ce2c42a6063ee26f2","observation_id":"f2364845-e7a3-42b2-aabf-6bfedb38550d","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:8da13445599b8a58a353ed9edfe2c04b40c5a36c1d744b95bb97bf2dd4bfa546","observation_id":"a14435aa-c078-49db-9e6e-fd965dfdc72c","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.01825","doi":"10.48550/arxiv.2308.01825","metadata_source":"pith","pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","venue":"cs.CL","work_id":"15eea2e2-dff3-42a7-842a-b663d50f64cb","year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:366b4e67a4fa6eb1ee99357615226f4d75497baf4a423da8aa14bb72f04435b3","observation_id":"dbaea259-7c1a-45ba-ae42-8fa99535ab11","resolution":{"observed_at":"2026-07-03T14:58:32.593485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T08:24:16.697802+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T08:24:16.697802+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:516f27d2eea15423bed738429fdd590280d54a7dda46336b1411a9a744c5908c","observation_id":"c1769cd0-afcc-4985-b3a8-474c7701c64f","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Zhang, T","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:c68eb8a4c16cc8e6616fbbceabea239234c0d6877959cad6cbfe8403e14e5633","observation_id":"22da3057-9e66-45a6-9f21-59a2f94b1add","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Zhang, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:a9e2bb4096e34628d2d5a55eb911264e01d4351e04f78ed363c28bc290fcdfba","observation_id":"49c54d17-50bb-4b4b-b3e3-79d32d433bce","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Zhang, K","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:ab7bc291ac4755c4704fffce757685e9286eeca5aafac5104ff2a5642d3d1691","observation_id":"82e7600c-262f-4e36-a9f8-17982c300744","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Zhang, H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:788a2148ecf4960f04689caa36dcdfaa4f1db1c35bde54f1e25b6d3c4005c883","observation_id":"9d6b5a9d-1565-46d0-b231-6acea866e0cf","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:5ce38f43e6083c80068d218ab7f9cd655433dcfbed378461b86df9f203340a05","observation_id":"40d34c25-d785-4e65-9207-c7cabe129b70","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"correct-over-incorrect","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:83551165405be52c23b41252f6498a505ed81897945d65e8356ba8fae155c8ad","observation_id":"9ee21f95-210c-4c3d-ac84-323e5009ddf5","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:c031854e0d9f5fc6f3fb0300237383476c6e57c1d71311d6ecca36e3a0d05e56","observation_id":"1bf8f619-3ef1-4f7c-8215-3bbea8568597","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:e0673ef50828df4889fb66662cb470c9f0d7f0cb3ada20515c04c30ff580e4c2","observation_id":"972ac47a-97b3-4697-a7ab-1383b5e61f95","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:b218d78d962edc214722a8d9a04935e6cf8b17cc841f0c906f1496a86c193ed9","observation_id":"27f0d0aa-d50d-43eb-9467-5479bb96583f","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Each agent must contain <agent_name>, <agent_description>,<required_arguments>, and<agent_output_id>","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:a8ddd25aa7dea8c3187b19447b98f00b6c95f9f48986299ba4934feff310aa34","observation_id":"06471bf6-be58-48f9-8b10-ed5ab3ec334e","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"agent_input must be an Info object","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:8fb6e018961531316a12701dad0cab4fce0ad7f481a0cadfcb622c50a08d9422","observation_id":"cce32bb3-4acd-40a8-9567-6d855033a5e3","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Please think step by step and then solve the task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:e09c86ed0d2585d845fea42f46e2617249fccb3b7dcac9f78ae0e205fd246493","observation_id":"76816c55-c69d-402a-9433-3938c89ad6a2","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Math Profes- sor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:34bad2591c008ad03ed0e03b2f4af9cc6a4591609a3caf4d2ae007ceabcdd95d","observation_id":"17e467cb-0ebe-478d-8fec-fa4bd86637dd","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Graph Theory Expert","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:9ace678d2922be946f7829c508996f3e5186882efa33ec720234633ef4db4ba5","observation_id":"f5139361-2982-4aed-86d2-57135c12e708","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"- The inequalities \\(x - yz\\textless y - zx\\textless z - xy\\) need to be analyzed to determine the regions where they hold true","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:388fb6f9db71769032aa0c4fe9a2c2a3bfab4239a8870806b77093df5864d16f","observation_id":"b1d0e5a0-0a15-4984-be5d-e0e7bd3206e2","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:5b5b232fec2bcf8a93828810e770e185b83258294ebd3221eb343bd68b3e2d63","observation_id":"72e91810-d29c-4e7c-9327-e3d1fe35d8c6","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Mathematics Professor","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:c45069d6bc6d1b73284adf0837e7abfc4adf5c6bfb12f168ac9406916dd73e50","observation_id":"d0b4b73f-d9be-4937-a64e-1c2a5e9cfc10","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:af29ef99b9d4ccf8b308632f46960239faf901eb2fd5320481bb1f167d8a99fd","observation_id":"15d8063b-778e-4d5b-8183-1952fac3f482","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Geometry Specialist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:c0b996e64b1a17011a892512c5ec647b3cb8a4b173f26af65b525f0575d20816","observation_id":"ab547592-da66-4a4d-9ccf-119cb80cf31c","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Geometry Specialist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:f1d2d52c5bb6ee43d0eb3cb75488f7c1638828e23cfc9a28e7c93418d8e93e0a","observation_id":"aaa051e6-b14a-45b1-872f-8449e336e447","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"The goal is to find the finite-area 21 convex region formed by these conditions and express its area in the form \\(a\\sqrt{b}\\), then compute \\(a + b\\)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:ce6b2c474a190c94644860312dff04922c87dd30e7bb3e2294c737f75db8996c","observation_id":"6c392a4a-73f0-44be-9cd9-a838d89741c8","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Geometry Specialist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:39032051fa9052266142d768ce7b3e3a15965640888b7ca7c13faf475c3e6e60","observation_id":"ce697945-1555-4ae9-99b2-81ea606fdb6e","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"\" (empty) as instructed, ensuring the original question is inserted by the parser. - debate_roles: A list containing two distinct expert roles (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:4fe04ee41a27c2eaf424199b96afe19a225fd6d2c7ff65b199b880064b099a9c","observation_id":"9f260b13-2d11-4f25-921d-17af8d440236","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Geometry Specialist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:8f7811cad140d83b3535e4152ef81f09255c0f69a1852eb18756dbd44cbe0ae6","observation_id":"193c0934-39f5-4eab-b40c-10feef58e947","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:660c27574ef0bc1b858f6e72bee3f2d017ae8090f5ca3df81bc922864daeda89","observation_id":"16c2dbd1-83dc-414a-bcaf-dbc47abb526c","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Geometry Specialist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:55a48dd5d83406791cee70f38a74715fdb1ef441a0b1ad405189b5956a1b4b7b","observation_id":"fd0e1402-a9a1-4fcd-b989-e0527eb9888f","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"\" (empty) as instructed, ensuring the original question is inserted by the parser. - debate_roles: A list with two distinct expert roles (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:5b68bcf9d0e8a31f78e5ba5ede1922c1f49b8d06760d716d5c7b22a3c9b0c995","observation_id":"69e49b68-3f45-4d50-aa79-66d8309fcc3a","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"This approach ensures both correctness and confidence through collaborative reasoning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:05affcc428fb51b5cbe2dcad4db1eb3389eac6a911e87f83612250a9ad360750","observation_id":"74bd07ea-d3d9-44ea-9c19-a1d74fcf1142","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:384843b4b82e7575e90cd0280555a410f5e3590194cc4a2a61dbb7f7a7769107","observation_id":"fcc02643-688b-4956-b033-f8f89be460c0","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:a14dd78fbae49dd79aa7938685a5461cf24020f4af71d444e58eb52b794245e0","observation_id":"41887c89-68b3-4a2e-ac48-dfef0ff5fd7c","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"completion year","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:edd23f5f5bd0c306b5e44c512f01988cdf2e6915c00fda77846bd2b788e4138e","observation_id":"bfee4610-fe6a-411b-a93f-5b0c17414990","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:44.867838Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:44.867838Z"},"links":{"citing_paper":"/paper/2606.13598"},"observation_digest":"sha256:172cb7850d964b4bd6508e46202273a265a4c1fb0f5cf01e8db027b032ed0bc2","observation_id":"c18c76f5-fdd7-4eb0-8aa7-b0f3d972b2f3","resolution":{"observed_at":"2026-06-27T06:51:44.867838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.13598","last_updated":"2026-06-11T17:16:24Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T04:39:20.555956Z","submitted_at":"2026-06-11T17:16:24Z","title":"Reward Modeling for Multi-Agent Orchestration"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2606.13598."}