{"as_of":"2026-08-23T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eed62e7645854ff983ffd007d6dd4630f811a9a66efb6d3dace204b6eafb06c9","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T10:15:37.280308Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:10:34.573818Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:10:34.802140Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19196","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2605.19196","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:67f9c1a73ff46eb182a026b573d957198331e3f721174c79ea36b4fd579e0f3c","observation_id":"77399758-2e3c-4b3a-bd63-8061acd33a9e","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19196","snapshot_observed_at":"2026-08-04T15:12:55.635905Z","title":"2026 , archivePrefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-15T22:59:26.336051Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.635905Z"},"links":{"cited_paper":"/paper/2605.19196","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:5cf75b021cc08f88096abc4351b0077be5f1eb8692b30550b556ae3b9349faeb","observation_id":"e182a7d9-0c82-410c-96fe-4efa8f5a5b55","resolution":{"observed_at":"2026-08-04T15:12:55.635905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"cited_work":{"arxiv_id":"2605.19196","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19196","snapshot_observed_at":"2026-08-11T13:10:34.802140Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","venue":"cs.CL","work_id":"758c5871-6428-4015-9a00-7da840bb54c5","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-15T09:23:37.498742Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.573818Z"},"links":{"cited_paper":"/paper/2605.19196","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:41984257bf9aeb688c344b4c4cdbeb2f71225e8dcd68b445adecf6178f418939","observation_id":"55fbe9c5-8aad-44a1-9f4b-1665da83e741","resolution":{"observed_at":"2026-08-11T13:10:34.811346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19196/citation-record","integrity":"/paper/2605.19196/integrity","json":"/paper/2605.19196/citation-record.json","paper":"/paper/2605.19196"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:5d35c381b4f415f8fee217e3e549cbf58f1d4102f5881fab09f37f9bbad51cca","observation_id":"356886a0-2e85-4089-9810-848988859a24","resolution":{"observed_at":"2026-05-20T10:18:11.838464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude haiku 4.5","venue":null,"work_id":"30429808-e110-4ebd-b2f6-2bbe0950ab0e","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:c134a781c715e1e653f3e6eb1a80956d5ef3affcee38721ec16f5b7a83d5108b","observation_id":"d591a02f-3dd0-42a1-8bd3-8eff9f8892d4","resolution":{"observed_at":"2026-05-20T10:18:12.358989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude opus 4.7","venue":null,"work_id":"cdc09fd2-f939-48e8-8729-840ad3783d73","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:9f0af54c63edec1290541e25a192e89dc22a33bbc65220722c7f280469d090fc","observation_id":"1e2b9691-4bd0-49f3-ae10-d59cab5c1d98","resolution":{"observed_at":"2026-05-20T10:18:12.370094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking large language mod- els in retrieval-augmented generation","venue":null,"work_id":"5b4782d4-630a-4397-88db-0376b3cdfd12","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:cd1e026303266df506b79f50393decf9493a2cadcb7eb31a398f7a1e8ef1fd6f","observation_id":"b9fccac4-766c-4e27-b441-3c6d35673f0f","resolution":{"observed_at":"2026-05-20T10:18:12.346091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19253","doi":"10.48550/arxiv.2505.19253","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepresearchgym: A free, transparent, and reproducible evaluation sandbox for deep research","venue":"ArXiv.org","work_id":"2f6b8cd2-51ef-4670-8361-26e737e919cf","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:9c6d6630cea329e27072a4483590d40774e57272d94e4076a408e38d5f6763e9","observation_id":"969b4227-fb9d-4029-990a-5fb841b7973d","resolution":{"observed_at":"2026-05-20T10:18:11.785323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-18T17:58:16.707563Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":"2506.11763","doi":"10.48550/arxiv.2506.11763","metadata_source":"pith","pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","venue":"cs.CL","work_id":"449edaa7-8f9d-4170-952d-4ab0d740572c","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:33d38a9bcae30b58773c4634dd92784bb8acfa43df3e42b1d966983ffc378f9f","observation_id":"a097571f-6501-418a-b96b-aebcfc860649","resolution":{"observed_at":"2026-05-20T10:18:11.788133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpacafarm: A simulation framework for methods that learn from human feedback","venue":null,"work_id":"acc1107b-cf96-496e-8bc7-da71cd961cfb","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:92fc4b042346af2b32f4cf1a874d67e23685f9f36e80485262ac070d472b9b91","observation_id":"b01fbb24-2c84-4cfb-afd5-eed3f595cc59","resolution":{"observed_at":"2026-05-20T10:18:12.349987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RAGAS: Automated evaluation of retrieval augmented generation","venue":null,"work_id":"0bd94be1-47cd-4b47-afc2-48daddcfffb2","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:b68ae456552c6a115e11653d39bcbfa4c07dda57cae3164d4bef9a34cff24d25","observation_id":"c3584117-ebb2-4b22-911c-1f129064559a","resolution":{"observed_at":"2026-05-20T10:18:12.344258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:26:58.667134Z","title":"Are we on the right way to assessing LLM-as-a-judge?","venue":null,"work_id":"0b78b728-f64e-40c1-9e6a-c0f076ff7adc","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:22944a8c669167c0722fb5524f4d539cf5f3d5058cea6795e2cd750162af628c","observation_id":"6233498b-3c8d-4fac-9938-7f12b5a55f94","resolution":{"observed_at":"2026-05-20T10:18:11.778593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06287","last_updated":"2025-05-06T15:28:50Z","snapshot_observed_at":"2026-08-21T03:52:23.870406Z","submitted_at":"2025-05-06T15:28:50Z","title":"Deep Research Bench: Evaluating AI Web Research Agents","version":1},"cited_work":{"arxiv_id":"2506.06287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06287","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep research bench: Evaluating ai web research agents","venue":null,"work_id":"e1864039-3ab1-4746-945a-315db926020d","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2506.06287","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:b323a52fd9f0ab0e570b76dd354ab46ac6665224e7e3da0c26ac28bf30b823e8","observation_id":"0caa09fe-b545-48a3-9d4b-96c4ce779b96","resolution":{"observed_at":"2026-05-20T10:18:11.859311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enabling large language models to generate text with citations","venue":null,"work_id":"36ff929e-65b8-48f3-affd-1146004c586c","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:907ac85581890d3bed8f6fc9a5a9f38d1665439524750af446237275d8b2244f","observation_id":"318d24b2-8816-4ef6-a277-f0cb637581eb","resolution":{"observed_at":"2026-05-20T10:18:12.342503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:eac2a434093639cd7b438449499d5987b4ef707642ced014c1e5f24ee047d254","observation_id":"da12364b-f7d3-4649-a6eb-a79592244c2b","resolution":{"observed_at":"2026-05-20T10:18:11.849298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.0 is now available to everyone","venue":null,"work_id":"214dc636-a967-4619-ab83-d90d3c3cd8d0","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:4ceafc770bb9968f80398249f7f1b749a868b644050745e6881825a8ef7d5722","observation_id":"04325a0e-fa2d-4036-89a5-bc55b54321e7","resolution":{"observed_at":"2026-05-20T10:18:12.338763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.5 flash is now in preview","venue":null,"work_id":"7d554d5f-1bb0-4349-b0ca-95a49f3ae233","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:83342552078f127eaf117cb44c4180721e93c5fdd31194dcdffd7e52b562bc70","observation_id":"bcc17993-8406-43cf-b13b-d84b23233eeb","resolution":{"observed_at":"2026-05-20T10:18:12.340710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":"f1b39b3a-a07b-4946-95d0-90a3f455d48b","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:d30911714b65de9741a297d8c4aa5e2d81b9af88b8ebf2603f8a864dec01dd10","observation_id":"194b3c1d-b2f0-4459-8932-45a987bb5a55","resolution":{"observed_at":"2026-05-20T10:18:12.337057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:d0fe330b38b635d66c7dc19dab80e0496a81d843d7bda397354c866dc778f5f2","observation_id":"5383023c-2a4f-4f3b-83b2-1000cbb0c944","resolution":{"observed_at":"2026-05-20T10:18:11.855294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.17776","last_updated":"2026-07-13T06:52:44Z","snapshot_observed_at":"2026-08-19T16:14:09.519712Z","submitted_at":"2025-12-19T16:46:20Z","title":"DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation","version":5},"cited_work":{"arxiv_id":"2512.17776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.17776","snapshot_observed_at":"2026-07-14T02:21:26.356765Z","title":"DEER: A benchmark for evaluating deep research agents on expert report generation","venue":null,"work_id":"0bddd642-1040-4828-90a6-63c441f3eca1","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2512.17776","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:23dab90bbfa25dbdfdc4dc88142c5ae012fc30da66dfb225dcef5dc4aebabc07","observation_id":"dca70804-cc33-4b7b-8515-941b3337bb5d","resolution":{"observed_at":"2026-07-14T02:21:26.356765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:17:15.158828Z","title":"Step-DeepResearch technical report","venue":null,"work_id":"c42bd6ab-38a7-4ea5-b488-cca082b9fb62","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:87d44e639fb5c2811fa51923af9291306e39cfea1dfdd4509a04b690e5df1031","observation_id":"81b5bc79-ac7d-486d-8f14-d30d92cc335f","resolution":{"observed_at":"2026-05-20T10:18:11.852269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MetaTool benchmark for large language models: Deciding whether to use tools and which to use","venue":null,"work_id":"d749e844-7256-42e0-aae0-0a0b6f0be13a","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:154a75d40accb761d73e44fd1f59fb90f047f18f251791a5fb4c9f0000de39f6","observation_id":"3898ed0f-35ae-4cc8-b26b-8a8d5e8b9f09","resolution":{"observed_at":"2026-05-20T10:18:12.335363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.503986Z","title":"Hwang, Varsha Kishore, Amanpreet Singh, Dany Haddad, Aakanksha Naik, Malachi Hamada, Jonathan Bragg, Mike D’Arcy, Daniel S","venue":null,"work_id":"6f95618f-a671-450f-86f0-1ab9513a24c0","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:c57a8bf5c47ce2a45b662caf6b3f4aef78a12a25f99bf880f5dad039a5a1c276","observation_id":"0f680140-27ca-4a5d-a314-fc12344d72fe","resolution":{"observed_at":"2026-05-20T10:18:11.769175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolscan: A benchmark for characterizing errors in tool-use LLMs","venue":null,"work_id":"0ac3fde1-09c3-4f75-99c8-0d41aa3f7651","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:1767c15982faefe230e1a0998a53351d09d2d5fc5f916e08eb85e164dcc9dc5b","observation_id":"6abafd53-aa75-4eb9-8c8a-fe8315b24a6a","resolution":{"observed_at":"2026-05-20T10:18:12.333548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20168","doi":"10.48550/arxiv.2510.20168","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepwidesearch: Benchmarking depth and width in agentic information seeking","venue":"ArXiv.org","work_id":"5e1710c1-9680-4b24-b62d-6179caa20023","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:569a29df37e63cf6ff05d3c8d0c2047025db65580f9fede5060162f54f2b089d","observation_id":"922621ac-c323-491b-aef0-811d3aa9a7ba","resolution":{"observed_at":"2026-05-20T10:18:11.830405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"70bf88ae-5fa0-47a8-82e2-6dbe9e8b97f5","year":2020},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:464f4e8362a20e42fd4949a11430a0e4aee3c0490372a263f200a9e13c4de5a8","observation_id":"d087d9cb-616d-4dd8-aeae-6c3e5e20ec50","resolution":{"observed_at":"2026-05-20T10:18:12.436930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15804","last_updated":"2025-08-14T03:33:43Z","snapshot_observed_at":"2026-08-19T15:02:06.571282Z","submitted_at":"2025-08-14T03:33:43Z","title":"ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks","version":1},"cited_work":{"arxiv_id":"2508.15804","doi":"10.48550/arxiv.2508.15804","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15804","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReportBench: Evaluating deep research agents via academic survey tasks","venue":"arXiv (Cornell University)","work_id":"cb426d3d-866c-4daf-81b7-dea902e27d4a","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2508.15804","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:067fa2bf3a22fb1b76bd6bcfdc0cb01924d7869c43966809f7355803bdda313d","observation_id":"63874281-696b-42b9-ba4b-30048d32597d","resolution":{"observed_at":"2026-05-20T10:18:11.803436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-21T02:23:44.629641Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"cited_work":{"arxiv_id":"2507.09884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09884","snapshot_observed_at":"2026-07-01T20:56:13.335126Z","title":"Verifybench: A systematic benchmark for evaluating reasoning verifiers across domains","venue":null,"work_id":"901f1726-1a8d-457d-96c3-40dcb729f89f","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2507.09884","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:7dc3f0e2f74aa2a1c9e96233f31fd0e61af968b71fb39665f863bbb474da7b57","observation_id":"3e09ee99-d4ad-46ba-9b71-fb408140785a","resolution":{"observed_at":"2026-05-20T10:18:11.800374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G- Eval: NLG evaluation using GPT-4 with better human alignment","venue":null,"work_id":"8ae51ce5-f7b4-4642-9431-573b68e52593","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:a09cac3a64b04d89c8ffb401e18e959a5b41b2ded8d650c4ffe2b7b15eaf6b42","observation_id":"14b5fa7a-51fe-4f1d-94dc-e7de63b735fd","resolution":{"observed_at":"2026-05-20T10:18:12.434253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ReIFE: Re-evaluating instruction-following evaluation","venue":null,"work_id":"5d1136f5-b897-4663-9740-30bfbe7214b9","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:1003863e4fdd0b8f8b2a0007ef9cb3d144d0dcea2466acda791cab8bdfac1c6f","observation_id":"a7836ef6-5a2f-4b99-92ea-09925b0210ce","resolution":{"observed_at":"2026-05-20T10:18:12.439050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:17:03.600265Z","title":"In: Zong, C., Xia, F., Li, W., Navigli, R","venue":null,"work_id":"8d675bdd-79ca-48d6-9163-fc17ce0e8ece","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:ab8aa59acba1b68d8d90a994acb6967a00ff20b3d79a3ae95e911ff5f95ac162","observation_id":"b4e25498-b6a4-464b-9e3f-20a859819fe4","resolution":{"observed_at":"2026-05-20T10:18:11.401397Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ToolSandbox: A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities","venue":null,"work_id":"8c8fd47d-89cd-4a61-a592-4714b71e5907","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:2baa9bbaa06fcd051aee1aae0bdaaf8b6f8c59ecea4b0f36b40237198ce29430","observation_id":"649f98e2-0ca0-4ada-ab91-a782de3a5971","resolution":{"observed_at":"2026-05-20T10:18:12.393784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.08942","doi":"10.48550/arxiv.2504.08942","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentrewardbench: Evaluating automatic evaluations of web agent trajectories","venue":"ArXiv.org","work_id":"4672f8c4-b6e4-4226-91be-6e4cb99e2669","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:090bdf1321e3f928e682d89726434736d74a046ddb3a6aa2a27668bb530f9182","observation_id":"aa31df63-7925-4dd9-a33e-9601a3395dde","resolution":{"observed_at":"2026-05-20T10:18:11.832940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Hannaneh Hajishirzi, and Nathan Lambert","venue":null,"work_id":"851dc574-ce6e-4144-973d-13cd441dc0d8","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:7da5f4f18e3fae6d6743d0733df3c22ad3c5a182aa6e7de7598c4cef2273a621","observation_id":"1ba4f070-f8b4-4409-98f8-0a29e4918be6","resolution":{"observed_at":"2026-05-20T10:18:12.395994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An expert schema for evaluating large language model errors in scholarly question-answering systems","venue":null,"work_id":"6074ac74-cc51-4aef-b75b-eb39cdd922a1","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:aee1dc05ab167767ccd05dabbee65a793abf0f1dadd274e082da83e33d6f121f","observation_id":"97044d86-e57e-4aa4-b6f0-68159b8ed96d","resolution":{"observed_at":"2026-05-20T10:18:12.399602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FActScore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"89ec7a00-84e4-4e7d-b4d4-4bee4fdc58e8","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:73ba404eac9dba63f5010f27c5cc1d5436566de666948af3727166e778867561","observation_id":"3322ce45-6ae3-4139-ad25-df4ee6620668","resolution":{"observed_at":"2026-05-20T10:18:12.391379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the moon is made of marshmallows","venue":null,"work_id":"73da690e-7bf2-4053-b968-afe003b8bd21","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:e28c6f0e7989e150d4787f827103a6253860c8c22ec2df21d7064442a185c576","observation_id":"09522d14-4ec3-40e2-97c4-c19e784f5f1c","resolution":{"observed_at":"2026-05-20T10:18:12.387570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-19T02:54:55.334346Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:235da1831cf7f936f5b3dc717253a3f8b8775f59accdd08e41e31c01aa118f16","observation_id":"fdaaacf6-2ddf-46c2-b030-58a7d2d6c1ec","resolution":{"observed_at":"2026-05-20T10:18:11.815874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RAGTruth: A hallucination corpus for developing trustworthy retrieval- augmented language models","venue":null,"work_id":"d55b6a31-ed42-49a1-9eac-b9397bf11fca","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:d2c7b91a22f52dde0217fe300a8351bebeef5ec95df7befaff41632f05f1daa7","observation_id":"ab0962c0-a14f-41e7-aaa3-c9c0ccb05c99","resolution":{"observed_at":"2026-05-20T10:18:12.409584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-5 mini","venue":null,"work_id":"d205f16a-8e2f-4ea3-bb8d-f247f6f2cce6","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:213fdb31488ebf59cdd288ff2de035bc1ff99f056f4c6eeefe70b2eb419fcc2c","observation_id":"969d2b44-2c8d-48aa-979c-faa1880548ec","resolution":{"observed_at":"2026-05-20T10:18:12.432131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt-5.3-codex","venue":null,"work_id":"c320b6e2-49c4-460b-95b6-cd71ef81d4f2","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:73d9362afc119164dd2ceace1289558387af620ce125f3a3b0803401c1597693","observation_id":"92eb6bda-046e-4194-8ef5-d72d36a0c282","resolution":{"observed_at":"2026-05-20T10:18:12.403453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-5.4 model","venue":null,"work_id":"18865b92-4cac-4cf1-96c5-a88346f4218f","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:e350984f1554b9d33fff519356a50bfd39ad6297b42142b43d3f5758b23d2800","observation_id":"68e52a06-4b6c-47a3-8ff6-3ad435c5f18a","resolution":{"observed_at":"2026-05-20T10:18:12.407373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez","venue":null,"work_id":"919c7e2f-8a2d-48b3-897b-d91d704b61a1","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:9c277cf3e6ff601fcf2aa08754e92c3916d2943e8177fae22104e321d92a813f","observation_id":"912bad08-d1f3-4ca0-ae3a-ed7cf5b280f3","resolution":{"observed_at":"2026-05-20T10:18:12.405338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"9d4d457b-6a0c-4262-b876-84bac7157f42","year":null},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:eb2534be211bc1d2e9d9acc48daff9324a63c87621113679e94a1785ce41baba","observation_id":"5721c5c7-9218-4214-8127-a7b59ac5d1e8","resolution":{"observed_at":"2026-05-20T10:18:12.377510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c432a2a-8a39-4a40-bff3-84d6ed89be82","year":null},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:548be993e24dea492a8f730b91f36ddb3218b12eadfd6957eaa58450897449ce","observation_id":"c212035f-dee0-404a-bf18-d96c7ba46e55","resolution":{"observed_at":"2026-05-20T10:18:12.444985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ARES: An automated evaluation framework for retrieval-augmented generation systems","venue":null,"work_id":"95bee4e9-30a3-403d-aae4-796fd662d62d","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:1d1642885ab03ca2943d4373d36b71eb18f36b1fcd54317e5e153c8bf176d688","observation_id":"56b562ed-bfb9-4e69-82cd-05316a156854","resolution":{"observed_at":"2026-05-20T10:18:12.451531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Localizing and miti- gating errors in long-form question answering","venue":null,"work_id":"19e89622-b5de-4a4a-b303-f9476c74364a","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:e41de6fcbc7d07f638339ff0301fcfa978ca13afd44ed008dc7a15706218fd11","observation_id":"4eff1a9d-e06e-4578-b371-4aaf7ec3b895","resolution":{"observed_at":"2026-05-20T10:18:12.415492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:33:50.930010Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"36685775-ea80-4fc4-a4d9-0155c9777e1e","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:3aeda716e8d13a0374ad8ac666babbfb7132b02992c9d654031267802dc1adfd","observation_id":"47714c6d-5f04-41cf-ac81-9d31a29eba7d","resolution":{"observed_at":"2026-05-20T10:18:12.418108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:44:56.569376Z","title":"arXiv preprint arXiv:2509.22391 , year=","venue":null,"work_id":"003d2377-e90a-4157-8101-682d51f04a15","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:e82087f9083e7560376526ad5bd2a6e39326d3aa27e06e8c169bc457e72c96ad","observation_id":"bf251382-38d7-4561-85dd-ea40cf98d7cc","resolution":{"observed_at":"2026-05-20T10:18:11.821552Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad8c7cb0-d98f-44d1-b919-abbf05f06d5c","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:281cb1d1d596b4c6ba8e017a55b430e85cd7075da991bfb82f5c27e90abc0aba","observation_id":"3ac7d08b-3892-454b-ac3f-1decb6b4093f","resolution":{"observed_at":"2026-05-20T10:18:12.366323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07685","doi":"10.48550/arxiv.2511.07685","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ResearchRubrics : A benchmark of prompts and rubrics for evaluating deep research agents","venue":"ArXiv.org","work_id":"4b4b3d79-0d0f-4c57-9d4e-37ea9fad28af","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:01ae60aeaad70dc511e43cd18a51f81a5cae17d5210682008e19230141ed0297","observation_id":"f269b83c-f0bb-48b5-877f-e617acc62f6e","resolution":{"observed_at":"2026-05-20T10:18:11.844903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judgebench: A benchmark for evaluating LLM-based judges","venue":null,"work_id":"7765e547-7a86-41cf-a6a7-e172e566bd65","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:8fb6b3fe59a953412b144e0a1b051b6153b1374b6ba109776f610a9b73e22cf8","observation_id":"212c6f5e-7fe0-4b81-bab2-c7ece8e43cf7","resolution":{"observed_at":"2026-05-20T10:18:12.371973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24701","last_updated":"2026-05-18T04:10:32Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:53:02Z","title":"Tongyi DeepResearch Technical Report","version":3},"cited_work":{"arxiv_id":"2510.24701","doi":"10.48550/arxiv.2510.24701","metadata_source":"pith","pith_arxiv_id":"2510.24701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tongyi DeepResearch Technical Report","venue":"cs.CL","work_id":"1c8db01b-b50f-4711-b181-a04bcc3e9aa8","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2510.24701","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:2ea1f9c74dbbef7f5b98f495747c90bb17e79e20bc2dd2c10d059ff0ebd98af0","observation_id":"da382f13-bc90-461b-b3d5-58b74139c138","resolution":{"observed_at":"2026-05-20T10:18:11.794452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09688","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepResearchEval: An automated framework for deep research task construction and agentic evaluation","venue":null,"work_id":"37d5a543-aba1-468d-9c22-7a9e11be5992","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:bdc83e9bc9ead3fec925d7a4fcb44e8958603f8e2f060aefedaea6cb15c720c7","observation_id":"427f3014-7067-40f6-ae4b-62e6b35c2a06","resolution":{"observed_at":"2026-05-20T10:18:11.835926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long-form factuality in large language models","venue":null,"work_id":"3aedc1dc-52a6-4af2-a08d-e25529409504","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:f6817a46e50818d79e893b0baf6f6451ef99ed7df9ebbf0ae0d437da538e42a5","observation_id":"4e4aad11-32d8-4b65-a560-297f5ee5b0d3","resolution":{"observed_at":"2026-05-20T10:18:12.375517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:dbc574f1615dd02ae4d659fe1855a222af3976516184c56b3c07c041209ac91c","observation_id":"6d507140-ac43-4703-9b41-7327e287f8c5","resolution":{"observed_at":"2026-05-20T10:18:11.841322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:20:47.299833Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"25b7630b-0793-4c04-bc81-1ca0da2d735b","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:7c3de55e6c1de1f6120d3bb7f57e9285f16e431a164b119c2430503232a7f201","observation_id":"c5d36093-ef6e-449b-a5c2-01b396888bb9","resolution":{"observed_at":"2026-05-20T10:18:12.381046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.818409Z","title":"Yao, Y ., Wang, Y ., Zhang, Y ., Lu, Y ., Gu, T., Li, L., Zhao, D., Wu, K., Wang, H., Nie, P., Teng, Y ., and Wang, Y","venue":null,"work_id":"8a7d5eea-633b-4676-b652-e03b14c9ab49","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:949a651cbb4ba10af2db329b54f52dbff9311ba7a3ac6dd9f32aa4b50db7bdd1","observation_id":"d7327b84-da56-4402-b4b6-b38b382311ad","resolution":{"observed_at":"2026-05-20T10:18:11.806131Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:19:04.119864Z","title":"MiroEval: Benchmarking multimodal deep research agents in process and outcome","venue":null,"work_id":"4c20e56f-e0b9-4469-b9fb-028fa3c28581","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:5b98b898a23d3ae15c4c4c4bf2c885e297a4b053742d5669330bc39f595bae0a","observation_id":"2a731a01-b628-4c2a-a7d0-b4ba7f035e81","resolution":{"observed_at":"2026-05-20T10:18:11.812625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yifei, Allen Chang, Chaitanya Malaviya, and Mark Yatskar","venue":null,"work_id":"4d4c4aa6-006e-40ce-8909-2c283a01b98d","year":null},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:f50ce61aece906f5e84cdc00c478019654f996e087e371988e23bd59c618bd54","observation_id":"e252c4b4-7021-41c4-84a1-9964e21c1868","resolution":{"observed_at":"2026-05-20T10:18:12.384073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.00496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:07:56.265515Z","title":"Yifei, Allen Chang, Chaitanya Malaviya, and Mark Yatskar","venue":null,"work_id":"012b34c2-72cd-4df5-9ac6-6f954320da1f","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:9fdfc44917ff4f1c1048b487338f34083b16c75f4b9dc8e59b4127fad66e17fd","observation_id":"f560a9ef-d05c-4437-b517-584a48670f8e","resolution":{"observed_at":"2026-05-20T10:18:11.791303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic evaluation of attribution by large language models","venue":null,"work_id":"7678cd2d-f62e-44a9-9b5d-ff263c636c8a","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:0771b842ed049bd421d7ed3c6b131fec9ad942a01d020c9657ea6081b7c7889f","observation_id":"4c37ec1c-6c41-47c5-bb82-651c89a329da","resolution":{"observed_at":"2026-05-20T10:18:12.401587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07641","last_updated":"2024-04-16T04:50:08Z","snapshot_observed_at":"2026-08-16T14:53:00.200868Z","submitted_at":"2023-10-11T16:38:11Z","title":"Evaluating Large Language Models at Evaluating Instruction Following","version":2},"cited_work":{"arxiv_id":"2310.07641","doi":"10.48550/arxiv.2310.07641","metadata_source":"pith","pith_arxiv_id":"2310.07641","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating large language models at evaluating instruction following","venue":"cs.CL","work_id":"dbb8d8ee-cad1-4787-981e-d4c0c8a549b7","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2310.07641","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:4bdb4902dce9d15e07d0a8bb81031f010db4f53c104df4ae5e2898184d2e4aca","observation_id":"b73c0e94-e94b-4087-ba06-fe4aa8320fe3","resolution":{"observed_at":"2026-05-20T10:18:11.809600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22984","last_updated":"2026-05-23T05:35:20Z","snapshot_observed_at":"2026-08-16T19:57:09.724101Z","submitted_at":"2026-01-30T13:49:09Z","title":"Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory","version":2},"cited_work":{"arxiv_id":"2601.22984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.22984","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why your deep research agent fails? on hallucination evaluation in full research trajectory","venue":null,"work_id":"deb0c3f9-2c99-4577-8701-f4a59202595a","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2601.22984","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:11d65d73ec4033e4d7ca3a20db3d07d9c40a313b7a6a9350d2bbea0f5f190bf5","observation_id":"8f500d94-9707-444d-a5ef-0b0d76f3b977","resolution":{"observed_at":"2026-05-26T02:03:08.823370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SRR-Judge: Step-level rating and refinement for enhancing search-integrated reasoning in search agents","venue":null,"work_id":"d5855297-400c-4be0-99a9-ebe228849140","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:bdfbc214dd25e26fdc389514d3f250362fe5cb307271a96ba7d52c3ff6ca7eb4","observation_id":"2dc813d6-d429-420a-8d3b-35eba1a23db2","resolution":{"observed_at":"2026-05-20T10:18:11.797516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02897","last_updated":"2024-09-10T07:43:19Z","snapshot_observed_at":"2026-08-16T13:21:19.977663Z","submitted_at":"2024-09-04T17:41:19Z","title":"LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA","version":3},"cited_work":{"arxiv_id":"2409.02897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.02897","snapshot_observed_at":"2026-07-04T11:09:47.208125Z","title":"LongCite: Enabling LLMs to generate fine-grained citations in long-context qa","venue":null,"work_id":"4617d3a2-ba4f-446b-a5bd-6027321dd23f","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2409.02897","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:039f292c47b9b4b96bfaaf7a5608ddace601649c6262223be6a38c0ffea938c2","observation_id":"ef89c5f7-10bd-4e41-9d91-679a9d9b9e6e","resolution":{"observed_at":"2026-05-20T10:18:11.772163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.06021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:39:31.175791Z","title":"Chaining the evidence: Robust reinforcement learning for deep search agents with citation-aware rubric rewards","venue":null,"work_id":"96709fe2-18eb-40b5-85aa-701ea86e19e4","year":2026},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:837253f9cc5e2cfa5d67827dad8458ef09495700057706722f22109cea6e3166","observation_id":"8d90eb97-92ab-4e9d-9027-44b79ad5dd7b","resolution":{"observed_at":"2026-05-20T10:18:11.775536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ToolBeHonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":"9847417d-2dbe-43ee-84c6-b38a8b339c46","year":2024},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:5c70ec8e1adc3cd89cf82b7000a34f12a6368ee8cddf651f67e6f2d5f4bb7b08","observation_id":"f0575d26-c00e-42ab-afd2-5e1ef1aeb063","resolution":{"observed_at":"2026-05-20T10:18:12.347961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging LLM-as-a-judge with MT-Bench and chatbot arena","venue":null,"work_id":"ee0edf7a-53f2-429b-9a78-6a3e4bc3480b","year":2023},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:c4b38902f8c957448fc0d648bfd5537bfca8b56f4a74f35457bfb80b79bb3c06","observation_id":"8c846851-0a1e-454c-8505-e648e08f14d8","resolution":{"observed_at":"2026-05-20T10:18:12.364556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10132","last_updated":"2025-01-17T11:41:53Z","snapshot_observed_at":"2026-08-21T07:36:20.094066Z","submitted_at":"2025-01-17T11:41:53Z","title":"ComplexFuncBench: Exploring Multi-Step and Constrained Function Calling under Long-Context Scenario","version":1},"cited_work":{"arxiv_id":"2501.10132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10132","snapshot_observed_at":"2026-06-29T13:13:27.295521Z","title":"ComplexFuncBench: Exploring multi-step and constrained function calling under long-context scenario","venue":null,"work_id":"032fd075-966f-46cd-b9f4-8b03ac993484","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2501.10132","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:079f936ffe507b56264b5988be515057e263ccc19b92d17d7d8badfedec31584","observation_id":"30e59f45-05f2-4ec3-9ba0-76165526b25e","resolution":{"observed_at":"2026-05-20T10:18:11.827795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating judges as evaluators: The JETTS benchmark of LLM-as-judges as test-time scaling evaluators","venue":null,"work_id":"fd73bd99-ab19-471e-b32f-e47b8ac71f39","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:0b9bf1bca27f0ee6d3bf9eed7915c0dfdf555675d182c1855dda400af0a7cde9","observation_id":"5a1d8425-0a16-4cfa-b107-8bc06dd9f7ff","resolution":{"observed_at":"2026-05-20T10:18:12.351898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25370","doi":"10.48550/arxiv.2509.25370","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"verbose database queries correlate with null results","venue":"arXiv (Cornell University)","work_id":"f5d9bb38-d94c-48e1-81b3-06c3398e72d1","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:ebfe5a9bd08e37d2feb2357a581bbc18c5b74e14d85e5cecc22131161270996c","observation_id":"2b9aa100-1956-4a75-b1db-1596db2c9d91","resolution":{"observed_at":"2026-05-20T10:18:11.824969Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:55.99496+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:55.99496+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"coherence","venue":null,"work_id":"6a2c6829-271f-4bde-956d-157281ae0d30","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:8bc9500750a1edb13c85cb07bc3ff5668fe1a4a374aaa56655e196cb1e336bab","observation_id":"e7158c4f-48d6-4b03-9c90-ba437f82154e","resolution":{"observed_at":"2026-05-20T10:18:12.456288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"453eb1dc-faf0-4447-ac14-335cf5754281","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:3fff7127d8f9741b83effd26f8b914d1a85727ac56daa206c578b1f5aee6df78","observation_id":"82bcd1fe-3c08-46b5-a2c4-a6e7b8c8b29e","resolution":{"observed_at":"2026-05-20T10:18:12.353489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2f795932-e129-40e0-a181-c5ccf2b2ced2","year":null},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:f98a5cb4c0001e34b31e83c1e74eeb465f82ac14dedc3cb82d2d46f93f809b29","observation_id":"4f120e13-9101-4a27-8dba-9969294aad0b","resolution":{"observed_at":"2026-05-20T10:18:12.355185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"adbd5415-bf9e-46d6-8433-332df1f045bc","year":null},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:1e354cbf9c4f7c3ab8160e7fe667ed41b70f24fbf29de42b44f6c6a864c5dc44","observation_id":"1ef56faa-67bd-47fa-97a7-89579e9d75d5","resolution":{"observed_at":"2026-05-20T10:18:12.356819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e486449c-775e-445b-8c52-e1f478e98e4a","year":null},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:4f3829f695b30385194274dc743b3b6443ae6871371d85ee81c194668f85c928","observation_id":"3d956fd0-8ce5-468d-adae-e7a766f5efc9","resolution":{"observed_at":"2026-05-20T10:18:12.368066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"891b331a-670a-4466-8c83-665ff96446dc","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:0344441f1a147bc25a29e892e54ba26c5e49f7b5ba521a4c902e4cd9176c5e74","observation_id":"aa61c76c-9b30-4974-9dd6-8eae63d94220","resolution":{"observed_at":"2026-05-20T10:18:12.373685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ac59938f-e8d5-42e0-b021-748dab9a1dc3","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:8e3726d5a1336f03ecd9f60478a7596c4be931b69b165b47c8b99a5b0ea0e8a6","observation_id":"968d2f76-2d18-46d1-920b-3a525e7bdb4c","resolution":{"observed_at":"2026-05-20T10:18:12.427282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c467d60-db70-4c71-ba3e-9fc294986642","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:cd43abf5e89db858d69e146ca60f110a54e89d938e39d05f064079e779160d63","observation_id":"fe88269b-071e-40c9-bd60-de959bae05aa","resolution":{"observed_at":"2026-05-20T10:18:12.446816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9d3c080-630a-45a0-8d05-56634cd2dcf1","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:dbf329bfa431464ff4b7c2a4758e4d5718eb7adec08524668ba0526d0393f3d0","observation_id":"934cfd80-e1cc-4e0b-974c-4a79709d4bf3","resolution":{"observed_at":"2026-05-20T10:18:12.448611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6f80af6-089f-4b38-a840-10f4870053ae","year":null},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:02cdd74a86df1f03845d3e56048435318be328e03ffddf175c857703c29d871d","observation_id":"f6a8d7db-9e8f-4de9-ba69-c0dd5ceac4dc","resolution":{"observed_at":"2026-05-20T10:18:12.453579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"58ac841c-fead-4f7c-9299-0f6dcaae1f94","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:c7d0150de3c4ebbd4355adfa44b21512e7031ba0d36a0d299ef300839c956249","observation_id":"0bace29a-5f93-4538-b101-8e04483d3f72","resolution":{"observed_at":"2026-05-20T10:18:12.443094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"appropriate human control","venue":null,"work_id":"68c5050d-c840-491f-a84d-15e574ab43b7","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:bb98381049809e5da1233de39c530dc575f33879717c7dac94268260bce11d41","observation_id":"7c6deaad-030e-42f9-8074-78d589c73673","resolution":{"observed_at":"2026-05-20T10:18:12.441002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T08:59:45.806077Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":12,"verified_exact":27,"verified_fuzzy":38},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 3 inbound Pith citation observations for arXiv:2605.19196."}