{"as_of":"2026-08-11T04:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acfa8f9e23aee0406f06059a5f94a29aa444708160132e06bfeeaf001a19406f","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:16:25.745948Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.12418/citation-record","integrity":"/paper/2501.12418/integrity","json":"/paper/2501.12418/citation-record.json","paper":"/paper/2501.12418"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T18:16:25.478505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.478505Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:7c7d3e38670f19aaee3067eca19cd4d0ec0cb8a98a5a2797e94a9ff28480f534","observation_id":"d3f1bcd6-c70b-4d87-898f-ed34590ff693","resolution":{"observed_at":"2026-08-10T18:16:25.478505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:25.489908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.489908Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:07936c521f54bc12528966e50daf4824a8f3d17232dc09ff53e279ac71d6b2e7","observation_id":"78ad0596-1cf7-42be-9a48-27e086ca04b9","resolution":{"observed_at":"2026-08-10T18:16:25.489908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.850028Z","title":null,"venue":null,"work_id":"fcdbc4ed-84e0-4512-8691-91fd587d85e8","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.500593Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:15cfe054135b947fb95399be37ba85d062055f68f59df697468830e53377177c","observation_id":"fd44d442-f1f2-4410-9704-411d6df1e24c","resolution":{"observed_at":"2026-08-10T18:16:26.855782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.830824Z","title":null,"venue":null,"work_id":"c5eec431-26d9-4aee-89fa-033baf82a5e5","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.506459Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:430c5828f8b48f44233a7967120efdd43a71f73743195c2940259ef963bbfdaf","observation_id":"5d661999-f36f-4037-b99f-76c5e0f1400f","resolution":{"observed_at":"2026-08-10T18:16:26.836411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03381","last_updated":"2024-07-23T11:54:10Z","snapshot_observed_at":"2026-08-08T21:09:37.741087Z","submitted_at":"2024-04-04T11:27:54Z","title":"Learning to Plan and Generate Text with Citations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03381","snapshot_observed_at":"2026-08-10T18:16:25.512501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.512501Z"},"links":{"cited_paper":"/paper/2404.03381","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:1686c19212101dace8a8823f030f05e50ef00502399e51587033806fa1eed613","observation_id":"6cfd4a4f-804c-41d2-a245-989a647ecb83","resolution":{"observed_at":"2026-08-10T18:16:25.512501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T18:16:25.518335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.518335Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:4ec6338a86942ef719fefbe57a1642f23bcdf186a9a0d43ce956cc379df32250","observation_id":"3ecb4581-1e0e-4db6-9bf9-3adb572429e4","resolution":{"observed_at":"2026-08-10T18:16:25.518335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14627","last_updated":"2023-10-31T15:04:35Z","snapshot_observed_at":"2026-08-07T16:43:54.797998Z","submitted_at":"2023-05-24T01:53:49Z","title":"Enabling Large Language Models to Generate Text with Citations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14627","snapshot_observed_at":"2026-08-10T18:16:25.525389Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.525389Z"},"links":{"cited_paper":"/paper/2305.14627","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:6614f62a70afa6710e53a4ee95c264b3bc40320a146b4c98a1d407943101dbf6","observation_id":"ca1e3466-f52a-470b-b095-c64f46e697cc","resolution":{"observed_at":"2026-08-10T18:16:25.525389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-10T18:16:25.531582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.531582Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:f82519bb6bfecbb677df04379a19eb92e997ad07e32999d94029c8cdaa5f529d","observation_id":"b3931a67-f4e3-4821-96e8-8b3a7ffa821d","resolution":{"observed_at":"2026-08-10T18:16:25.531582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12837","last_updated":"2024-10-03T22:29:47Z","snapshot_observed_at":"2026-08-07T20:19:18.658172Z","submitted_at":"2024-10-03T22:29:47Z","title":"A Comprehensive Survey of Retrieval-Augmented Generation (RAG): Evolution, Current Landscape and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12837","snapshot_observed_at":"2026-08-10T18:16:25.537683Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.537683Z"},"links":{"cited_paper":"/paper/2410.12837","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:5d5a104712d1d95c7b5ec67df664b8b54dae71d209a86e7c0fd452d156267566","observation_id":"cd25219e-df64-40b9-b348-54153b77cf7f","resolution":{"observed_at":"2026-08-10T18:16:25.537683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09188","last_updated":"2024-04-15T16:09:33Z","snapshot_observed_at":"2026-08-07T15:36:01.866930Z","submitted_at":"2023-11-15T18:28:29Z","title":"Towards Verifiable Text Generation with Symbolic References","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09188","snapshot_observed_at":"2026-08-10T18:16:25.543464Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.543464Z"},"links":{"cited_paper":"/paper/2311.09188","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:76112c14785ac8b10fc305d32c7afce31589a78e36f2cea429f3d9f7f3a43ba8","observation_id":"2440a93c-3f7d-491a-a1f3-68822f06b681","resolution":{"observed_at":"2026-08-10T18:16:25.543464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04315","last_updated":"2024-08-30T18:24:27Z","snapshot_observed_at":"2026-07-06T17:26:27.288834Z","submitted_at":"2024-02-06T19:00:40Z","title":"Training Language Models to Generate Text with Citations via Fine-grained Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04315","snapshot_observed_at":"2026-08-10T18:16:25.549812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.549812Z"},"links":{"cited_paper":"/paper/2402.04315","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:ba63c140eea000cf1f6fd693ce2960986aac060a94026fda30674fbd60c63ac0","observation_id":"61773371-c9bc-4a60-bf0b-9c0035504e97","resolution":{"observed_at":"2026-08-10T18:16:25.549812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.814031Z","title":null,"venue":null,"work_id":"bc52a634-c606-4cd6-9991-7da4c49cf5d7","year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.555646Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:686fb4d609e08b7e0c9287c2e23088903281e959703368a50e7cf2f0e4e9172f","observation_id":"c2001045-7c55-4b96-a412-b82bd13399a4","resolution":{"observed_at":"2026-08-10T18:16:26.819478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.794574Z","title":null,"venue":null,"work_id":"ea84a1ba-229a-4300-b590-777789a6904e","year":2019},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.561384Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:4ec633d6cc2f0dc09bf74fca83aac84d3a81bc50ce57d3fbaef12927ded43213","observation_id":"3942e530-2209-421a-bc6d-ed3cbdb689c9","resolution":{"observed_at":"2026-08-10T18:16:26.800976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T18:16:25.567338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.567338Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:0c761abf079f9942056815b0f51bd36f59470034a67679c8f95a105aee0dce79","observation_id":"c9148c76-5f53-48ab-a03c-9e23f89f2945","resolution":{"observed_at":"2026-08-10T18:16:25.567338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.774165Z","title":null,"venue":null,"work_id":"2aa1cf45-4110-46ca-ab6e-848be3496b2b","year":2015},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.573600Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:86d49deb6044e5e8fd3360914c94aaf2e8832ecf314674a86ca9329e978e47ca","observation_id":"1b394101-d2d2-4ddb-bec2-f56c560aded5","resolution":{"observed_at":"2026-08-10T18:16:26.779772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.748577Z","title":null,"venue":null,"work_id":"49c74399-5d27-4072-9746-943520a67a7d","year":2022},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.579592Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:78057998ca7345ea2ca11e772700e35ff94631024cef41c0add169940882af56","observation_id":"089bacb6-b49e-45d5-9fcb-a5911443e629","resolution":{"observed_at":"2026-08-10T18:16:26.755031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06384","last_updated":"2023-09-08T09:39:53Z","snapshot_observed_at":"2026-08-09T22:21:48.206525Z","submitted_at":"2023-09-08T09:39:53Z","title":"Towards Reliable and Fluent Large Language Models: Incorporating Feedback Learning Loops in QA Systems","version":1},"cited_work":{"arxiv_id":"2309.06384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.06384","snapshot_observed_at":"2026-08-10T18:16:26.112916Z","title":"Towards Reliable and Fluent Large Language Models: Incorporating Feedback Learning Loops in QA Systems","venue":"cs.CL","work_id":"10b42a2a-5829-4164-9da4-ed9ddb8bd27a","year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.585379Z"},"links":{"cited_paper":"/paper/2309.06384","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:b1a6a26a8ab1d03308104672d85d18cb3e36fd7d2c5182f2bf913b1aa2a5cc46","observation_id":"a8484ff9-f8e0-4ab7-a617-943a4ead9f4a","resolution":{"observed_at":"2026-08-10T18:16:26.120152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18381","last_updated":"2024-03-27T09:19:13Z","snapshot_observed_at":"2026-07-06T17:51:48.378864Z","submitted_at":"2024-03-27T09:19:13Z","title":"Improving Attributed Text Generation of Large Language Models via Preference Learning","version":1},"cited_work":{"arxiv_id":"2403.18381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.18381","snapshot_observed_at":"2026-08-10T18:16:26.082172Z","title":"Improving Attributed Text Generation of Large Language Models via Preference Learning","venue":"cs.CL","work_id":"92927b8e-4877-40da-b194-954d77d92171","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.591478Z"},"links":{"cited_paper":"/paper/2403.18381","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:93be07374afdcbfa592ab7e0f7f58fc9e99c1f28a9802ebff0bd36a671cea29f","observation_id":"649546f3-a34b-40fe-ac77-b628926cbb85","resolution":{"observed_at":"2026-08-10T18:16:26.089678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.728227Z","title":null,"venue":null,"work_id":"f1d2a3a8-981e-40d1-8331-f42f67aac710","year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.598412Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:799e4c793268c3900ad9a92ebebb5f03542bd6e1757b32a1e0ca55dae6d49b1e","observation_id":"97b966fe-596c-4582-a2d5-ff7f850a019a","resolution":{"observed_at":"2026-08-10T18:16:26.734247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.707765Z","title":null,"venue":null,"work_id":"369dceac-9835-4ccd-93d1-2acf9eed0a0c","year":2022},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.604077Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:371b206962d3c42d4a5964e03f51fdba8314f765b4a97c2a1c6fe60766b0805e","observation_id":"d097dc70-7d00-4245-b8a4-ab888f08bf8f","resolution":{"observed_at":"2026-08-10T18:16:26.714210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.682746Z","title":null,"venue":null,"work_id":"e61b953a-ff1f-4092-a575-f025d861b5ea","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.610224Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:74e17886a283aafbb2a36651713fb2a74da8c9f5feec63d66845ccc29358407a","observation_id":"4799352b-a7d1-4f1b-b085-ad4609652a67","resolution":{"observed_at":"2026-08-10T18:16:26.690333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.661205Z","title":null,"venue":null,"work_id":"60e16d9e-e6f6-4290-9b58-67f00294951f","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.615354Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:0b4aac80e2ac4c45f96e2d6227854447ac27cb0bda5a399914b4d317fbb4da14","observation_id":"fc911385-58c2-4d29-8960-28a2efed4a5f","resolution":{"observed_at":"2026-08-10T18:16:26.668979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T18:16:25.621128Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.621128Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:03b3e0b9f8595d501db60adf7d972b70024f8667601301da6b1d2defb61fcb1b","observation_id":"7957f7e0-13a0-49d0-bc50-6a40f7e65fa1","resolution":{"observed_at":"2026-08-10T18:16:25.621128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.635233Z","title":null,"venue":null,"work_id":"153f5a52-fe8d-4589-b99d-568fb184f311","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.627439Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:183a254ebd71c08b127e74dea9798e0097a7d75406e01369b3ea6e9b936e33ff","observation_id":"0ba157aa-1050-4032-b4de-ad8a13b995d8","resolution":{"observed_at":"2026-08-10T18:16:26.644069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08700","last_updated":"2024-10-02T07:26:40Z","snapshot_observed_at":"2026-08-10T08:08:10.793829Z","submitted_at":"2024-04-10T18:08:59Z","title":"DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08700","snapshot_observed_at":"2026-08-10T18:16:25.633276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.633276Z"},"links":{"cited_paper":"/paper/2404.08700","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:7eff74e606e74471538a2fbb201a4308d58a518b75c08f52ee590d69c7181d0d","observation_id":"5484146a-643a-449c-898a-9a95aadc7e39","resolution":{"observed_at":"2026-08-10T18:16:25.633276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.613542Z","title":null,"venue":null,"work_id":"a4ae8381-4c81-4766-895b-337eef31c08e","year":2020},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.640027Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:0a54bc89967ec6955968c5019ea52cf94354bc4e7ad6f77944654258862ecf1d","observation_id":"39cb3076-c777-471f-b7a5-f00248c93f6f","resolution":{"observed_at":"2026-08-10T18:16:26.620189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.578450Z","title":null,"venue":null,"work_id":"ed3e421d-b5ac-4e6a-9de0-421dff299a5a","year":2022},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.646855Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:8a761530840e0b32622c81fd307f471a3b3f0f2a686587dbf9f150b68b0659cf","observation_id":"87af93bd-6f40-4b73-bba1-372d988aa146","resolution":{"observed_at":"2026-08-10T18:16:26.587531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11227","last_updated":"2022-01-26T22:57:44Z","snapshot_observed_at":"2026-07-06T12:31:37.941737Z","submitted_at":"2022-01-26T22:57:44Z","title":"Synchromesh: Reliable code generation from pre-trained language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11227","snapshot_observed_at":"2026-08-10T18:16:25.653670Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.653670Z"},"links":{"cited_paper":"/paper/2201.11227","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:4dd29bdda859dc22565e4761237e3170eb1256b5e5f405471f41a6be06d302dd","observation_id":"7e2fdcbe-a844-4989-97bc-092846acb64e","resolution":{"observed_at":"2026-08-10T18:16:25.653670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.552186Z","title":null,"venue":null,"work_id":"c0b5aca3-bcb8-4ce1-9487-e5c7d42731ab","year":2021},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.659144Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:f300ecb9692889884a704f57e80c536fc2adee0ff1eac2ab0cba186b083aed8d","observation_id":"58397e66-d170-454b-926a-d1997761ea6a","resolution":{"observed_at":"2026-08-10T18:16:26.560725Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04662","last_updated":"2024-12-17T08:37:34Z","snapshot_observed_at":"2026-07-06T18:58:35.218405Z","submitted_at":"2024-08-06T02:13:15Z","title":"Citekit: A Modular Toolkit for Large Language Model Citation Generation","version":2},"cited_work":{"arxiv_id":"2408.04662","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04662","snapshot_observed_at":"2026-08-10T18:16:25.964337Z","title":"Citekit: A Modular Toolkit for Large Language Model Citation Generation","venue":"cs.CL","work_id":"144a3956-3acf-4186-9c9f-aa62164672b4","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.665773Z"},"links":{"cited_paper":"/paper/2408.04662","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:501bbcf912d57adc7d5a1b18d0816f416e71cf0ac54f45997a8f111cce31f0a1","observation_id":"e253b605-890b-4671-9ba9-84ef2227c51d","resolution":{"observed_at":"2026-08-10T18:16:25.974877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.526067Z","title":null,"venue":null,"work_id":"0c9f4308-b77f-4a03-958d-f307508ed764","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.671292Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:dff9bead9ae18ed70fc64ebcffff2bb16b0062b23b4f4faacc605ff2efcd9f7b","observation_id":"6b93e68f-306c-4521-9ca8-fa02621dbc03","resolution":{"observed_at":"2026-08-10T18:16:26.532493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01313","last_updated":"2024-01-08T16:19:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T17:56:30Z","title":"A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01313","snapshot_observed_at":"2026-08-10T18:16:25.676939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.676939Z"},"links":{"cited_paper":"/paper/2401.01313","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:d3a5b38e7c9f99cb22d9208752f034b8545c50b8eece70f75c46df155bd2d834","observation_id":"b53eb951-6531-4e0b-95ed-faa89f2851c2","resolution":{"observed_at":"2026-08-10T18:16:25.676939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.505135Z","title":null,"venue":null,"work_id":"98211f6b-ce72-4832-88cb-6f0175a3108c","year":2017},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.682144Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:b42906ffee538a17eb2f18f254a0d59ed6fcfee1792f9223031e29a1b407c34c","observation_id":"344f8f6f-a051-4bd0-83d1-85b5b879be5f","resolution":{"observed_at":"2026-08-10T18:16:26.511687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T18:16:25.687214Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.687214Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:8c42fb765011eb63e5805ec04a83cc4045314361abe6cac3438acf40a097f17c","observation_id":"019bafe7-4c6c-4911-b4a1-5ae5d81c959a","resolution":{"observed_at":"2026-08-10T18:16:25.687214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-10T18:16:25.692816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.692816Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:aa30d3dbd7f5ecd7d8e457b4b2b6ddcf63cb46b3eaec7cfd993a50c7ff345602","observation_id":"e402273f-a06f-44c4-bf4d-67f400b16324","resolution":{"observed_at":"2026-08-10T18:16:25.692816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.485346Z","title":null,"venue":null,"work_id":"1ebc1915-a782-48b4-8a89-47e3524edf39","year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.698440Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:b1bb30bc16dd0e10dcd2859ea783f4fea18435c06e7388d7ee004b2492f416b5","observation_id":"241b834d-f3d9-4120-84ee-13065d37bbd8","resolution":{"observed_at":"2026-08-10T18:16:26.490873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-10T18:16:25.704108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.704108Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:4480ee6bae88d139a0d6d1c71555cf2df8574d27693a37bafc8befdca72dbdf1","observation_id":"c812ddfb-7440-4723-a8db-be9867f96b6b","resolution":{"observed_at":"2026-08-10T18:16:25.704108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:26.462223Z","title":null,"venue":null,"work_id":"982cf461-bc4c-45d3-b89c-ba9931c7e3b3","year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.710476Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:c2207be44703ceef2bd92c825f519fe39dffd2f9d92de19cf3e9abb5eec4023f","observation_id":"4fc75928-77d6-4d36-98e4-d9bab9f44392","resolution":{"observed_at":"2026-08-10T18:16:26.469151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02897","last_updated":"2024-09-10T07:43:19Z","snapshot_observed_at":"2026-07-06T19:10:29.880696Z","submitted_at":"2024-09-04T17:41:19Z","title":"LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02897","snapshot_observed_at":"2026-08-10T18:16:25.717571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.717571Z"},"links":{"cited_paper":"/paper/2409.02897","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:99ce5628a35c5f0765c38d67b5b0924325ef5865d216759d1b679fdd7e99bd10","observation_id":"1bfce028-bca9-48bf-b799-e1a9dbccfb10","resolution":{"observed_at":"2026-08-10T18:16:25.717571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03862","last_updated":"2025-02-22T01:13:38Z","snapshot_observed_at":"2026-08-03T19:20:15.059209Z","submitted_at":"2024-04-05T02:27:09Z","title":"Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03862","snapshot_observed_at":"2026-08-10T18:16:25.725604Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.725604Z"},"links":{"cited_paper":"/paper/2404.03862","citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:f6276436693cee1118e4368fc6f5020af44e2310b3b665cda7245ec812050aa7","observation_id":"fe6e9f42-aa12-431a-8146-69411c6c6d09","resolution":{"observed_at":"2026-08-10T18:16:25.725604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:25.731564Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.731564Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:8bb3d034c3f2e19efbab92c4c2a106af9ee5fe8594d293e73d7a7ce303cb6ad0","observation_id":"3c686bcb-82a8-49ce-9c05-5c9128ca258b","resolution":{"observed_at":"2026-08-10T18:16:25.731564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:25.737702Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.737702Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:6bc6c9ffd698f4a1f00c13acd9a5dec4b55d694d3d05d990fce4156ce7f7ee87","observation_id":"2f5fddca-8002-424b-8c90-b1eb12485805","resolution":{"observed_at":"2026-08-10T18:16:25.737702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:16:25.745948Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T18:16:25.745948Z"},"links":{"citing_paper":"/paper/2501.12418"},"observation_digest":"sha256:eaf973cab0621e801510e216b26fd678ce0b3b21d93da51c69b59340bef9d526","observation_id":"30148be3-d543-49a2-8f81-e7d975819348","resolution":{"observed_at":"2026-08-10T18:16:25.745948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12418","last_updated":"2025-01-20T13:43:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:51:03.004748Z","submitted_at":"2025-01-20T13:43:45Z","title":"ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2501.12418."}