{"as_of":"2026-08-09T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99fb3de29c750da6bb5e7afe8b7b673f3593379f430c9835fc5bbd13f893e366","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:49:37.685430Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02198/citation-record","integrity":"/paper/2509.02198/integrity","json":"/paper/2509.02198/citation-record.json","paper":"/paper/2509.02198"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.05375","last_updated":"2025-07-18T14:38:50Z","snapshot_observed_at":"2026-08-07T01:34:14.442812Z","submitted_at":"2024-11-08T07:05:06Z","title":"Ev2R: Evaluating Evidence Retrieval in Automated Fact-Checking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05375","snapshot_observed_at":"2026-08-05T11:49:34.114274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.114274Z"},"links":{"cited_paper":"/paper/2411.05375","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:c4103ef9cdbd83db40aed246c2d5245a6a452aeb9c7ec887e2bb95bf148f4964","observation_id":"109d96ab-84f0-4fc1-bcf1-e423f1aa045e","resolution":{"observed_at":"2026-08-05T11:49:34.114274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:34.184495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.184495Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:dee5c2e3d80f8e578084c7d2bf4c3ba0b9719acf023cd589cc409777fdf8ef18","observation_id":"c55697eb-8024-4ea7-8d76-a9b4c5544369","resolution":{"observed_at":"2026-08-05T11:49:34.184495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:34.303517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.303517Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:4ce1eeca6625a668e519d6dca269daa0a153890d75afc25a292ab12ccbef027f","observation_id":"7cf22791-b8f9-49a4-b5a3-b78f766f1075","resolution":{"observed_at":"2026-08-05T11:49:34.303517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12086","last_updated":"2024-05-26T16:37:01Z","snapshot_observed_at":"2026-08-05T02:52:57.190461Z","submitted_at":"2023-10-18T16:27:49Z","title":"FactCHD: Benchmarking Fact-Conflicting Hallucination Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12086","snapshot_observed_at":"2026-08-05T11:49:34.402359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.402359Z"},"links":{"cited_paper":"/paper/2310.12086","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:344d4ff268d4993b114978c26220961bf4f1ae3ca3af14861f28958c4e9635da","observation_id":"89acc67d-aaa3-4d0d-ba06-e4f43973457e","resolution":{"observed_at":"2026-08-05T11:49:34.402359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13528","last_updated":"2023-07-26T15:17:49Z","snapshot_observed_at":"2026-08-08T04:21:09.421738Z","submitted_at":"2023-07-25T14:20:51Z","title":"FacTool: Factuality Detection in Generative AI -- A Tool Augmented Framework for Multi-Task and Multi-Domain Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13528","snapshot_observed_at":"2026-08-05T11:49:34.496837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.496837Z"},"links":{"cited_paper":"/paper/2307.13528","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:89c34bfac43af39e1030f9c64ce95b3c55789b3fdc4181e60973ab4590c455ae","observation_id":"68371e48-20fe-4e1a-a34d-326ac0395d43","resolution":{"observed_at":"2026-08-05T11:49:34.496837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:40.089494Z","title":null,"venue":null,"work_id":"81a66c6d-1f95-4c2c-8db3-ae0904c48664","year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.594311Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:e552d0fa3b027f78d09f503bb6786216b6f087d9840df43ba0e21b2bc09eff92","observation_id":"c0c1ee87-9bf6-4424-a615-57d0512487d9","resolution":{"observed_at":"2026-08-05T11:49:40.184588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:34.726398Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.726398Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:1d50ab4365f6bc23f11c6442c91ce3d36ff04aff03c923f23875a9ecee63675f","observation_id":"b3a475c5-a31b-4fd7-9cc7-9137347f404c","resolution":{"observed_at":"2026-08-05T11:49:34.726398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:34.813450Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.813450Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:808df39bbe7bbefaa7d446ca5e1d61032e3dc325860da06042f22445300d5254","observation_id":"c036fda2-b86b-4aa4-84ea-06fbc66fa91c","resolution":{"observed_at":"2026-08-05T11:49:34.813450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T11:49:34.900754Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:34.900754Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:ce9ef7768ffa46a80ab5a486ba563566ba9041c22285ef377f9d2faae3e9729e","observation_id":"602bd9f0-618c-4457-8fcf-f1944754698f","resolution":{"observed_at":"2026-08-05T11:49:34.900754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:35.009251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.009251Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:230c6da1e39730e8eead5a5ff90062834997d8e85dbaa23d9d8315b5a41bed96","observation_id":"c9e258d2-00b9-4f0e-a265-e31f45e21cb2","resolution":{"observed_at":"2026-08-05T11:49:35.009251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.724","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:38.156311Z","title":null,"venue":null,"work_id":"3bef839c-d893-4b36-87bd-7172c2a1e0b3","year":2022},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.130933Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:256fecab622d900485ba6a6d34fd498b1e24cf409ce24c9047bdcbd9959f3c39","observation_id":"ad3ac3ca-8043-47d5-b69e-d6dbfc28d21e","resolution":{"observed_at":"2026-08-05T11:49:38.224577Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:35.237877Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.237877Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:3d72fc22e73b9fcdcc05dd250fbe9f020b9b94a6bec63b0294ee6b2d17997882","observation_id":"d9e27792-0ba8-4f49-bff3-31d07d9d3f31","resolution":{"observed_at":"2026-08-05T11:49:35.237877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T11:49:35.374269Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.374269Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:f9069c2bd71bbbe117c5c3d29759979b1232cfd47541637883b316c6c985b2f2","observation_id":"8d098079-9250-4727-9125-e7506cc82d56","resolution":{"observed_at":"2026-08-05T11:49:35.374269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:35.502342Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.502342Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:9947133235b433b65b108e80e1506335465b231756c99f4f5cb0dd5032e60c62","observation_id":"78ebf89e-34ef-4c75-9d1a-48fc246e8c60","resolution":{"observed_at":"2026-08-05T11:49:35.502342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:35.636262Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.636262Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:a9642100ece513f7bf1e3b18b004025ed9974fb6a5c2dc3607b0b1575e56cfd9","observation_id":"f04cc43b-da8b-43fa-88e5-e06f5ea9d419","resolution":{"observed_at":"2026-08-05T11:49:35.636262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T11:49:35.735157Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.735157Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:a41e6bdcd4f6930f634edf99549961245413c19bf061f01dd87f4e3624033543","observation_id":"4bf0e5e9-c923-4f07-b974-3793a9662b2d","resolution":{"observed_at":"2026-08-05T11:49:35.735157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T11:49:35.839752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.839752Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:a64902b51342cc14412c4de4c80daa4d4db42027f9d44bbf47de4ae853180662","observation_id":"afe80fc9-18c5-4ca6-a73e-9cf387fe92aa","resolution":{"observed_at":"2026-08-05T11:49:35.839752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:39.833283Z","title":null,"venue":null,"work_id":"bd76dd28-aeb0-47db-abc4-ffe4c7a41a18","year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:35.950122Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:6473dab2c9e7febf4d1fc586a510d7f64e61f13cc8c24201fa51cfd5b3f059de","observation_id":"8dfd6a38-2465-4980-9454-c172f52d4c03","resolution":{"observed_at":"2026-08-05T11:49:39.951041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.036045Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.036045Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:7de26ec6bf995de8d908a773d16b8726999da5087f5d2c23f3de104147f89df2","observation_id":"ed74b3f3-41cc-44f0-94cf-5c9356a862ed","resolution":{"observed_at":"2026-08-05T11:49:36.036045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.141612Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.141612Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:9090d5f091a8d2feae13992e76185edc61c9bbd59cb6317c922c346abb4d62da","observation_id":"55be45d1-2543-4182-ba7a-7e656b0bf16b","resolution":{"observed_at":"2026-08-05T11:49:36.141612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.215299Z","title":"Bennett, and Marti A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.215299Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:b8975175d1c7c821a54f2cf779805e2ee66606d64497375f7c327994eaa0d8f2","observation_id":"6fbb1223-b585-4545-bcb6-5a0e0dc69c65","resolution":{"observed_at":"2026-08-05T11:49:36.215299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:39.595433Z","title":null,"venue":null,"work_id":"3e003d27-4266-431f-9bc0-ec726f64aec2","year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.336001Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:ed90a382fa59eb3dbb97d4268474cdd47aa95c83f88db64078364e41629fcffb","observation_id":"7a46d527-1d48-42a6-8e28-22273445200d","resolution":{"observed_at":"2026-08-05T11:49:39.685784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.404378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.404378Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:9952e34dcda49f4d87f4d8569e643d657eaee2fbef65b8d172c3a86231e92105","observation_id":"df2c9356-8962-4469-8670-2fed404fed8f","resolution":{"observed_at":"2026-08-05T11:49:36.404378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.470534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.470534Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:4e44dc31a845993f7997a2c0b0db6c7f55fc34de5d81516ceec1aa24b228f291","observation_id":"c211d761-f6e4-43a7-bc2e-909d8eeef4fa","resolution":{"observed_at":"2026-08-05T11:49:36.470534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.559343Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.559343Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:793d61906cfb59f6d1bad94c70fb93e2ac3aaab4e8b28ee0e506a91c47277f44","observation_id":"6491c496-5aaa-4c8b-b457-cd3258f09b22","resolution":{"observed_at":"2026-08-05T11:49:36.559343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.644650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.644650Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:90a3d60c072f278a97454e5f86102c5267f2185ade05245d930aa9ab418ae152","observation_id":"01f73d1e-db95-4daf-87c9-5ba6db86c608","resolution":{"observed_at":"2026-08-05T11:49:36.644650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-industry.97","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:37.837750Z","title":null,"venue":null,"work_id":"30705cbd-b324-4ce7-a8c6-ef9c6478509c","year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.724464Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:589e7868c4b2e95dbfe84280394e7b8c288d181aa4432f8bf666a72eec0a2b9d","observation_id":"0045d9d1-f571-43d0-9668-0d88b2029069","resolution":{"observed_at":"2026-08-05T11:49:37.884291Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:39.498307Z","title":null,"venue":null,"work_id":"8e3a214d-678f-41bb-b90c-51c6da05df3a","year":2021},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.841013Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:fa49f7dac5f65d40331226fe54ecc580b5931d733863e6643572bc385aa09d82","observation_id":"4949615b-9cea-43ee-bfef-756ad0e042f8","resolution":{"observed_at":"2026-08-05T11:49:39.562832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05948","last_updated":"2023-05-16T08:19:44Z","snapshot_observed_at":"2026-08-06T09:57:42.022057Z","submitted_at":"2023-01-14T16:38:04Z","title":"tasksource: A Dataset Harmonization Framework for Streamlined NLP Multi-Task Learning and Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05948","snapshot_observed_at":"2026-08-05T11:49:36.922834Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.922834Z"},"links":{"cited_paper":"/paper/2301.05948","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:be0a9c992fffa6b45ad47c66a41769685a92d5a41fdecb4aa959d31744ba08bd","observation_id":"9a684d4c-e6a6-410d-9b40-27e0eed2c725","resolution":{"observed_at":"2026-08-05T11:49:36.922834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:36.986183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:36.986183Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:4ae159f1ac6bf1446dc62e9b3ca05535902482d740e391395bb081ab88046fe8","observation_id":"b47bd57c-a7fd-4074-bdf3-3f2e47d79df7","resolution":{"observed_at":"2026-08-05T11:49:36.986183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T11:49:37.065089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.065089Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:06a2e789e0859a8cab78168c038d8b7178728501a180acd6e10601c39967fdbb","observation_id":"4b16c0f2-4f28-4824-9fad-5818b7befcc4","resolution":{"observed_at":"2026-08-05T11:49:37.065089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:39.358273Z","title":null,"venue":null,"work_id":"58a24512-de41-4503-9f06-88088be37e84","year":2022},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.119553Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:fcabaa302c65764d6895fa1ae1a1703ec337f9125e3a0dca28507b19fa1c8c84","observation_id":"c93e9956-2cb3-4c82-96c1-5e7664a3d549","resolution":{"observed_at":"2026-08-05T11:49:39.412202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03987","last_updated":"2023-08-12T14:57:37Z","snapshot_observed_at":"2026-08-04T09:02:49.602701Z","submitted_at":"2023-07-08T14:25:57Z","title":"A Stitch in Time Saves Nine: Detecting and Mitigating Hallucinations of LLMs by Validating Low-Confidence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03987","snapshot_observed_at":"2026-08-05T11:49:37.219681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.219681Z"},"links":{"cited_paper":"/paper/2307.03987","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:233b7a2a81bb789726eb605664eb4f32b588ba6f69988ade9ce4ca5a0eb335e0","observation_id":"5dde900f-37ac-4974-952f-e7eefb06b8d7","resolution":{"observed_at":"2026-08-05T11:49:37.219681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-05T11:49:37.302932Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.302932Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:92c5d720b29cbefca013dc61feae915df236b8896ff21a13383da1967a5047c5","observation_id":"4b92d26f-39a4-4eba-a3f7-10ad453697b9","resolution":{"observed_at":"2026-08-05T11:49:37.302932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T11:49:37.363452Z","title":"Chi, Quoc Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.363452Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:4787a827d5e798d933ada14481148da41fbf3829bf95d237e652bf72c3dad19f","observation_id":"03e2cf4e-f5f7-4d2a-947a-a3bddc6ff438","resolution":{"observed_at":"2026-08-05T11:49:37.363452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-05T11:49:37.426698Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.426698Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:17cfaa4230a602bde0c9b9104a6e40a4bfea237693e00ee1e9cd9e477f60044b","observation_id":"bd1ec3dc-f4dc-4819-a6eb-07a5e3120fbf","resolution":{"observed_at":"2026-08-05T11:49:37.426698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:39.211481Z","title":null,"venue":null,"work_id":"be22ec02-2de1-4642-a36d-7367d5b66366","year":2024},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.502010Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:0ec03e76e72f6375dace7e0c6205e77177f5f57b3851aecd3878c0a1ca9731bc","observation_id":"91931a1c-e096-456c-8196-40b97d5cd33e","resolution":{"observed_at":"2026-08-05T11:49:39.268051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:39.109410Z","title":null,"venue":null,"work_id":"5bc715fc-852e-4d18-959e-a4f257d7ccbf","year":2023},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.619573Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:a5eed139fd722e3787aeb69a2f5dab43379364677c638638a91fba01f7b89873","observation_id":"bb0d0631-73d4-433d-bde2-b62b47e6c5aa","resolution":{"observed_at":"2026-08-05T11:49:39.167809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:37.653941Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.653941Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:1cfcc0378b5ce89ca38e70a371a0695011c3ae1f032c90a4ad63122de9c197d4","observation_id":"36dbd05f-db23-4302-ba29-f83677e14729","resolution":{"observed_at":"2026-08-05T11:49:37.653941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:49:37.685430Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T11:49:37.685430Z"},"links":{"citing_paper":"/paper/2509.02198"},"observation_digest":"sha256:c83cb9a83be45d6cdad816cc854dfdd06d481ae4fd6217c6c7cf88137ac690f4","observation_id":"6635d21b-b61e-4919-87ec-5348f7cc4266","resolution":{"observed_at":"2026-08-05T11:49:37.685430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02198","last_updated":"2025-09-02T11:09:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T11:23:30.131763Z","submitted_at":"2025-09-02T11:09:52Z","title":"FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2509.02198."}