{"as_of":"2026-08-10T14:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06770d6f491b76acaebecd037e666519a88a7892c5f27e890b64497d72b204ec","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:11:34.287353Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T00:05:16.851179Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T03:25:57.760381Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"cited_work":{"arxiv_id":"2509.04499","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04499","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"762be891-e54a-4561-a20d-c6c557e284b2","year":2025},"citing_paper":{"arxiv_id":"2605.07896","last_updated":"2026-05-08T15:40:18Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:40:18Z","title":"What if AI systems weren't chatbots?","version":1},"reference_index":185,"source":"pdf_text","source_observed_at":"2026-05-11T03:21:58.498789Z"},"links":{"cited_paper":"/paper/2509.04499","citing_paper":"/paper/2605.07896"},"observation_digest":"sha256:f51ac723f3263e82eacce465639714a5fdbd69cd856e7b835937be5e1f443787","observation_id":"d4cf8085-492e-4ea4-8a3c-709cf9896ef3","resolution":{"observed_at":"2026-05-11T03:25:57.763934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04499","snapshot_observed_at":"2026-07-31T00:05:16.851179Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25151","last_updated":"2026-07-27T23:50:46Z","snapshot_observed_at":"2026-08-06T12:12:05.597891Z","submitted_at":"2026-07-27T23:50:46Z","title":"HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:16.851179Z"},"links":{"cited_paper":"/paper/2509.04499","citing_paper":"/paper/2607.25151"},"observation_digest":"sha256:c99695c396339a6b955edb8b8bc2426bb02a625b5ce812c179aa09c06ea529c1","observation_id":"0d4dc21a-3bc8-4671-9efc-deb5df358022","resolution":{"observed_at":"2026-07-31T00:05:16.851179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04499/citation-record","integrity":"/paper/2509.04499/integrity","json":"/paper/2509.04499/citation-record.json","paper":"/paper/2509.04499"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06600","last_updated":"2025-08-08T17:55:11Z","snapshot_observed_at":"2026-08-09T01:34:46.047851Z","submitted_at":"2025-08-08T17:55:11Z","title":"BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06600","snapshot_observed_at":"2026-08-05T12:11:33.925590Z","title":"Browsecomp-plus: A more fair and transparent evaluation benchmark of deep-research agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:33.925590Z"},"links":{"cited_paper":"/paper/2508.06600","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:29a24f98c719c985b79dbea4f447df75cf73b1be405d22a6ee83440cefbeb51c","observation_id":"7823c93a-edcc-402f-b2f2-e680d0563bcf","resolution":{"observed_at":"2026-08-05T12:11:33.925590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-05T02:02:34.574070Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-05T12:11:34.144349Z","title":"Ragas: Automated evaluation of retrieval augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.144349Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:0cf346eab8c76c0009f567bc19091e0de10d0fae23b8681a3b7755d70ebcbe5e","observation_id":"3013c672-c55a-4d1c-9682-a485aa7943df","resolution":{"observed_at":"2026-08-05T12:11:34.144349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08406","last_updated":"2024-01-30T13:55:34Z","snapshot_observed_at":"2026-07-06T17:16:13.055978Z","submitted_at":"2024-01-16T14:44:47Z","title":"RAG vs Fine-tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08406","snapshot_observed_at":"2026-08-05T12:11:34.167576Z","title":"Rag vs fine-tuning: Pipelines, tradeoffs, and a case study on agriculture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.167576Z"},"links":{"cited_paper":"/paper/2401.08406","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:f6b757fecb30780f16f993cabdbdf6897eb50e4467bca58bae900d416db0f08a","observation_id":"b9dc44bc-a79a-4578-b5c2-3e942b1c687e","resolution":{"observed_at":"2026-08-05T12:11:34.167576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-05T12:11:34.177271Z","title":"doi: 10.18653/ v1/2024.findings-acl.41","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.177271Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:900811066a067a08da3716d677a00106364a6aef2ec6153444c76e0d5dfc39f8","observation_id":"11c798c6-88fc-41ce-bb7e-2f2f82e5404c","resolution":{"observed_at":"2026-08-05T12:11:34.177271Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.789263Z","title":"Evaluating large language models for health-related queries with presuppositions","venue":null,"work_id":"f94c62ea-ead1-48d2-a2f7-cc66001974f0","year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.193117Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:afee9223b3f42ee05d96b862465dd1973ff7c148dec1d2d2b940eb7163e26441","observation_id":"be94324d-07da-420b-b4b8-c615ede5ab49","resolution":{"observed_at":"2026-08-05T12:11:34.795469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.772451Z","title":"URL https://aclanthology.org/2024.findings-acl","venue":null,"work_id":"3b4cab78-8458-4e0e-b290-78686e0798bc","year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.198673Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:56352f974cf0330dcd955961fa510a8f7bb1a7090e18d470469e20722f2b37cd","observation_id":"b852ff80-9a9c-4d66-8c7b-3dfe52d4cc33","resolution":{"observed_at":"2026-08-05T12:11:34.777440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14540","last_updated":"2023-05-23T21:50:06Z","snapshot_observed_at":"2026-07-06T15:32:06.975391Z","submitted_at":"2023-05-23T21:50:06Z","title":"LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14540","snapshot_observed_at":"2026-08-05T12:11:34.208721Z","title":"Llms as factual reasoners: Insights from existing benchmarks and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.208721Z"},"links":{"cited_paper":"/paper/2305.14540","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:e4c1305b6c1beae4204dcf1ea2aa9c4fbece0cc1a080df6735b97d23b2cef26e","observation_id":"781b68b5-d02b-423b-b110-12113439cfb4","resolution":{"observed_at":"2026-08-05T12:11:34.208721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.213637Z","title":"Evaluating verifiability in generative search engines","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.213637Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:0b0190f9cec5b92ed0fd34764b19e87a02aa48a658eafc41b846fa89e06659b6","observation_id":"0c21a836-6d0a-4fe0-a99c-ae75ed72e686","resolution":{"observed_at":"2026-08-05T12:11:34.213637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T12:11:34.218030Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.218030Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:2976bf8de48eb51332c5028f505f0ce759cf3e8eb96d81b96ff5e461a95a6dce","observation_id":"126f7511-dd2e-421b-a71c-92957b87db53","resolution":{"observed_at":"2026-08-05T12:11:34.218030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.744154Z","title":"Towards a holistic approach: Understanding sociodemographic biases in nlp models using an interdisciplinary lens","venue":null,"work_id":"a7639129-bea7-4718-ba44-fcb92b3689c6","year":2023},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.222910Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:80c6a71af189e4d1fd7cec5556fdf339eeebbb7b03507d0a9152a8a8a9ec370b","observation_id":"6dccbcbb-204b-4e8d-bbc9-9b3b80d17c0b","resolution":{"observed_at":"2026-08-05T12:11:34.749138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.727343Z","title":"Search engines in the ai era: A qualitative understanding to the false promise of factual and verifiable source-cited responses in llm-based search","venue":null,"work_id":"a09ca03b-8c03-4a6a-bbd7-fd0afe7c1474","year":2025},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.227365Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:3a25b1a1c4b9e86be4ad4cdf9628e517579b12364de1d9921f7e233bdac8c86c","observation_id":"64492b73-914c-40e4-a48a-e3624a884437","resolution":{"observed_at":"2026-08-05T12:11:34.732373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14499","last_updated":"2025-02-20T12:28:23Z","snapshot_observed_at":"2026-08-08T19:15:34.002979Z","submitted_at":"2025-02-20T12:28:23Z","title":"MLGym: A New Framework and Benchmark for Advancing AI Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14499","snapshot_observed_at":"2026-08-05T12:11:34.231652Z","title":"Mlgym: A new framework and benchmark for advancing ai research agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.231652Z"},"links":{"cited_paper":"/paper/2502.14499","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:9dc10655fdb9295bb1bddfa69e4bc2e43bb52192decf85285fec0b45db01eb41","observation_id":"9593ae03-a769-400c-bd17-8ebad3f56a97","resolution":{"observed_at":"2026-08-05T12:11:34.231652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.708680Z","title":"AMRFact: Enhancing summarization fac- tuality evaluation with AMR-driven negative samples generation","venue":null,"work_id":"f5361e81-76d0-402d-817b-856006c50f76","year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.237189Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:67cb4b019d30438227e083d4d772a85568d6d915c7bd70f18b8673afb195ff44","observation_id":"10320c5b-8d04-4d97-b52c-8017b84917ad","resolution":{"observed_at":"2026-08-05T12:11:34.715479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.241721Z","title":"doi: 10.18653/v1/2024.naacl-long.33","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.241721Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:bd09cfab2a66c0f851c6e1419165300a08874d5b4bcc5c852f5c9cf0b6c27a44","observation_id":"93a6344b-313e-430d-8bab-483dbfadaad6","resolution":{"observed_at":"2026-08-05T12:11:34.241721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12873","last_updated":"2024-07-15T17:40:15Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-15T17:40:15Z","title":"Evaluation of RAG Metrics for Question Answering in the Telecom Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12873","snapshot_observed_at":"2026-08-05T12:11:34.247219Z","title":"Evaluation of rag metrics for question answering in the telecom domain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.247219Z"},"links":{"cited_paper":"/paper/2407.12873","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:19199401a59690caf991982d9fea0e73c4c0f004ab7036f0b8fc03f19e9ac67b","observation_id":"6ff17efd-2ccb-40aa-a291-e7281088edcc","resolution":{"observed_at":"2026-08-05T12:11:34.247219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10774","last_updated":"2024-10-01T15:39:48Z","snapshot_observed_at":"2026-08-08T10:18:48.258465Z","submitted_at":"2024-04-16T17:59:10Z","title":"MiniCheck: Efficient Fact-Checking of LLMs on Grounding Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10774","snapshot_observed_at":"2026-08-05T12:11:34.251807Z","title":"Minicheck: Efficient fact-checking of llms on grounding documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.251807Z"},"links":{"cited_paper":"/paper/2404.10774","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:9ef9942225b4114fb7e60227ded9e86a4fc7924c35ec74271590652870d77de2","observation_id":"21e73924-ae84-4953-8327-dd62c7313cd2","resolution":{"observed_at":"2026-08-05T12:11:34.251807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07461","last_updated":"2024-09-14T03:14:09Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T03:51:29Z","title":"An Audit on the Perspectives and Challenges of Hallucinations in NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07461","snapshot_observed_at":"2026-08-05T12:11:34.257317Z","title":"” confidently nonsensical?”: A critical survey on the perspectives and challenges of’hallucinations’ in nlp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.257317Z"},"links":{"cited_paper":"/paper/2404.07461","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:a291396dd7a65b46605ac10d26eb0a595a6dce77e765b385c6da9dbfdc2e3b0d","observation_id":"3d1e1ee4-d3d4-4691-8a57-091e900ec4fe","resolution":{"observed_at":"2026-08-05T12:11:34.257317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04644","last_updated":"2025-07-14T20:06:23Z","snapshot_observed_at":"2026-08-10T05:10:02.806455Z","submitted_at":"2025-02-07T04:08:46Z","title":"Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04644","snapshot_observed_at":"2026-08-05T12:11:34.262789Z","title":"Agentic reasoning: Reasoning llms with tools for the deep research","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.262789Z"},"links":{"cited_paper":"/paper/2502.04644","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:c1cfeab42ab34720a771d7c2cc870fa1a492c979bcdd4ad6344ea0fb53115469","observation_id":"739d0dda-4089-4998-8ef1-903c676ed2fd","resolution":{"observed_at":"2026-08-05T12:11:34.262789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10198","last_updated":"2025-02-07T05:11:18Z","snapshot_observed_at":"2026-08-10T12:32:55.011248Z","submitted_at":"2024-04-16T00:43:03Z","title":"ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10198","snapshot_observed_at":"2026-08-05T12:11:34.268788Z","title":"How faithful are rag models? quantifying the tug-of-war between rag and llms’ internal prior","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.268788Z"},"links":{"cited_paper":"/paper/2404.10198","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:1fd0eac68d899562f77f2d1f8b6fefdfb2d88c5cb5c639cb32f40003da79a0aa","observation_id":"0b060272-c084-446e-b192-9712ed71c677","resolution":{"observed_at":"2026-08-05T12:11:34.268788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-05T12:11:34.273162Z","title":"Deep- researcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.273162Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:7954b74fc6cd1b86458bcc77a18204287678ea3bb92e04e32acb1bfe195e6ac0","observation_id":"5779e042-20b3-4fdb-a671-1223b1e58183","resolution":{"observed_at":"2026-08-05T12:11:34.273162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01262","last_updated":"2025-03-03T22:45:57Z","snapshot_observed_at":"2026-08-09T02:40:02.382162Z","submitted_at":"2024-08-02T13:35:11Z","title":"RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01262","snapshot_observed_at":"2026-08-05T12:11:34.278284Z","title":"Rageval: Scenario specific rag evaluation dataset generation framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.278284Z"},"links":{"cited_paper":"/paper/2408.01262","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:2772ed341208f1e239625f7baf962d12403c89ba97714b908c9e82bf016353e8","observation_id":"825b2d9e-1750-4537-8cc2-a6e3fe9e482e","resolution":{"observed_at":"2026-08-05T12:11:34.278284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.691659Z","title":null,"venue":null,"work_id":"79f5abf8-b897-42f4-a068-dd16452944e6","year":2025},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.283087Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:e77b787e07ebd85af09b8a0c5357b1a3ebb2e060428ac151728a51cc56ada8c8","observation_id":"4378976d-0391-4a1b-8fb9-0f15f5861088","resolution":{"observed_at":"2026-08-05T12:11:34.696479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.673682Z","title":"why should we ban bottled water?","venue":null,"work_id":"63588edd-7157-4e11-8bd5-1e2873b33cdf","year":2023},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.287353Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:b1727d973f8ea72a1e9cbc74b2df71d85a97c56ef0fef41db90f8b000da30416","observation_id":"168f026a-924d-4c0f-a961-74dde6bd3edc","resolution":{"observed_at":"2026-08-05T12:11:34.679820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01261","last_updated":"2024-09-30T17:39:59Z","snapshot_observed_at":"2026-08-08T11:10:01.706250Z","submitted_at":"2024-04-01T17:33:38Z","title":"FABLES: Evaluating faithfulness and content selection in book-length summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01261","snapshot_observed_at":"2026-08-05T12:11:34.203975Z","title":"Fables: Evaluating faithfulness and content selection in book-length summarization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":850,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.203975Z"},"links":{"cited_paper":"/paper/2404.01261","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:8730569effd925a5c48ff161be9165e0623754cb458e259aa718d7b1dfa4df70","observation_id":"701066d6-a89f-4555-a29c-f495092c50dd","resolution":{"observed_at":"2026-08-05T12:11:34.203975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.825449Z","title":"Do LVLMs understand charts? analyzing and correcting factual errors in chart captioning","venue":null,"work_id":"b27e0b7e-b1f6-437f-b25a-e59a69b784a8","year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":1973,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.172678Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:44f4f4609d21827c54ec4baa46e465da2b94d6d758911c184713d2070898846e","observation_id":"1817579f-0e06-4273-a8b9-e37e8552ba73","resolution":{"observed_at":"2026-08-05T12:11:34.830141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.807813Z","title":"Adaptive-rag: Learning to adapt retrieval-augmented large language models through question complexity","venue":null,"work_id":"a61cdc7a-8387-4269-adfb-aba580a93bfe","year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.187938Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:6858fdfb0b7290bbe62e255f249c4a07642e88362b7fcd16ad47e2d76e60d844","observation_id":"4225e9eb-2dfb-4a23-9860-9a1279076526","resolution":{"observed_at":"2026-08-05T12:11:34.814135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-07T14:15:18.269910Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-05T12:11:34.040150Z","title":"Deepresearch bench: A comprehensive benchmark for deep research agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.040150Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:356a9ee4ef70525dd14ff608834ba94f0321e92848a928210b4cc031a0fadcb2","observation_id":"3e402624-09d6-4fba-bd94-dfd4655d5470","resolution":{"observed_at":"2026-08-05T12:11:34.040150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-06T23:20:46.744749Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18096","snapshot_observed_at":"2026-08-05T12:11:34.182534Z","title":"Deep research agents: A systematic examination and roadmap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:34.182534Z"},"links":{"cited_paper":"/paper/2506.18096","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:c6bc72df125f6c8d7320174be7b9fa683648a2ab59b4c55ba5e4206181172418","observation_id":"5a57a8e9-b3f6-4ac9-9bd9-67b214770385","resolution":{"observed_at":"2026-08-05T12:11:34.182534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06287","last_updated":"2025-05-06T15:28:50Z","snapshot_observed_at":"2026-08-07T15:49:29.444913Z","submitted_at":"2025-05-06T15:28:50Z","title":"Deep Research Bench: Evaluating AI Web Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06287","snapshot_observed_at":"2026-08-05T12:11:33.637116Z","title":"Deep research bench: Evaluating ai web research agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:33.637116Z"},"links":{"cited_paper":"/paper/2506.06287","citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:9ca0dd07ed8504d3540e106efd3a5d26febd050cfb44ab9177f98d245f9348b3","observation_id":"8587929c-a81f-45af-a2bb-4ff14eaefd61","resolution":{"observed_at":"2026-08-05T12:11:33.637116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:11:34.840701Z","title":"Evaluating top- k rag-based approach for game review generation","venue":null,"work_id":"5b427329-e8f7-4470-bf57-5df6fce5ec34","year":2024},"citing_paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:11:33.766309Z"},"links":{"citing_paper":"/paper/2509.04499"},"observation_digest":"sha256:b9103663103767f30f522a362121dfd4aa81b7660f5e0858787579dddab9400c","observation_id":"49c24558-4356-4933-b435-8cc352dab517","resolution":{"observed_at":"2026-08-05T12:11:34.845478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04499","last_updated":"2025-09-02T00:32:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T20:35:53.900959Z","submitted_at":"2025-09-02T00:32:38Z","title":"DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2509.04499."}