{"as_of":"2026-08-10T15:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a544e2cf7d26f5bbaac91f88e81f4357a019c57f16cdb130ccbd766956cf861","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:29:27.951706Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":65,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-11T13:44:09.626361Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2305.10355"},"observation_digest":"sha256:66e020249fb390fa1bc144ab4b501cfd55ba0cecfe6edd4308d67b12867ee562","observation_id":"36daf7e4-f826-41e6-b75a-17c9a5908b9f","resolution":{"observed_at":"2026-05-11T13:44:09.992326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:63b58d45b2250aff812e04e378ff9c3c614d53bc6cd38500a8ec5ccdd7838241","observation_id":"1fc21cfc-c9fd-4b51-bde8-4f916e6eab78","resolution":{"observed_at":"2026-05-10T20:25:34.533899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:bddfe6cef636762e3149a75e86b2a631ea495001bec384d67ab690f894a29c6a","observation_id":"86dbe26a-9234-4a96-bcfa-090610f47140","resolution":{"observed_at":"2026-05-16T02:56:42.661294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T17:34:56.836034Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2306.14565"},"observation_digest":"sha256:bb6b46afc4a10dc011a2ffba2992924092f11118a3f5c6d9b3bb455ee731601c","observation_id":"d4a385d0-b631-4b8f-a8a9-6f49cd240e8a","resolution":{"observed_at":"2026-05-14T17:34:56.925616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T01:52:01.163900Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2308.01390"},"observation_digest":"sha256:ea934b652c289700f392ddd6f1b7050b92cfa01c1dae03597b9fc3c63956c6b3","observation_id":"6d0cf446-ed1d-46b4-bd04-78d0f90a5ff8","resolution":{"observed_at":"2026-05-14T01:52:01.218129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-09T18:54:02.679174Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"reference_index":290,"source":"pdf_text","source_observed_at":"2026-05-11T10:47:44.152066Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2309.07864"},"observation_digest":"sha256:e249c5122d07cb824f261ef12f67395b0e52f5f1dc4cddaa0b0006329d8a50f4","observation_id":"8d63810e-811b-41fe-b39f-90fe5ddeca6c","resolution":{"observed_at":"2026-05-11T10:47:54.086446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T19:11:33.783746Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2310.03744"},"observation_digest":"sha256:29048b513ec988b26632d21499aeaacabc1bba3e23646c46c06df714952f28b7","observation_id":"5d60023b-8956-4dff-90c9-98a8381dbbe8","resolution":{"observed_at":"2026-05-12T19:11:33.871504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T07:13:08.867745Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2310.09478"},"observation_digest":"sha256:712a0efd9eb8f825631bcd82d66b4f80098087a0a7a07da60e1170f954fad321","observation_id":"cf8190b8-135e-4957-980f-dc37a0eb712d","resolution":{"observed_at":"2026-05-16T07:13:08.967416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:ecc98e1410114a0972fb8300cba1f7821e51e785fe253cec9022080f2ab5805e","observation_id":"8f444185-6efc-40b1-b169-19812663166e","resolution":{"observed_at":"2026-05-18T03:18:51.645922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-14T18:08:01.166072Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2311.10122"},"observation_digest":"sha256:6b40ae5a1ab935b7ba020a07410abb6cf21b1f1f843ceca67c1f8e7c5adabf8d","observation_id":"d08b84ba-c7ed-4b61-934a-b1d3d5ad9029","resolution":{"observed_at":"2026-05-14T18:08:01.377521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:f0e3803d8029b58d21b4cd64f6797b6e34c2d25e3f5ac021240e32d3f0ec8f87","observation_id":"3f44ad43-9dd2-4b8c-8bd0-78657d63d7b0","resolution":{"observed_at":"2026-05-17T20:22:35.127729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:30.143907Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2401.15947"},"observation_digest":"sha256:f8990d4c579485a8d9afca7d8a2860d8e315f39004bc016688d2c6a8e20ed589","observation_id":"57dce32c-9cbd-4f79-92b6-bde2d0787588","resolution":{"observed_at":"2026-05-16T02:33:30.287822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:24e234eb261edab671eb85ae9b8217c5b26587ddf1b9696fa2dc19347374016d","observation_id":"5c10f305-4288-4827-a656-462842bf09e0","resolution":{"observed_at":"2026-05-16T04:09:36.115905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:23f0f9f97899e2333ab2c4c39335b78c4aff1bfb8c2362b54c563996f430d3e1","observation_id":"ad5d363d-ffeb-4beb-ae4f-f7c953c45272","resolution":{"observed_at":"2026-05-11T12:33:33.719546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:867c2197a2272a09c2c1834531f2e648ad5308652f73b2855933bc25d639cee4","observation_id":"4f0c569c-2947-40d3-b5a5-39c76f571b76","resolution":{"observed_at":"2026-05-20T06:20:36.388847Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2408.12935","last_updated":"2026-05-13T07:56:42Z","snapshot_observed_at":"2026-08-02T12:48:59.218457Z","submitted_at":"2024-08-23T09:33:48Z","title":"AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions","version":4},"reference_index":255,"source":"pdf_text","source_observed_at":"2026-05-23T21:54:26.670284Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2408.12935"},"observation_digest":"sha256:15f335a959ac0fa5f7fc31463bb2621e17fde20a61204c47be4c41bd3db79f90","observation_id":"c90589bd-17d0-4111-86b3-031d14f5aefe","resolution":{"observed_at":"2026-05-23T21:55:50.308479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2411.18275","last_updated":"2026-04-21T10:31:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-27T12:09:43Z","title":"Visual Adversarial Attack on Vision-Language Models for Autonomous Driving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T16:35:24.063578Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2411.18275"},"observation_digest":"sha256:17e8e26985dd7e10025bad1b8d54b7412c0f44f684f414036e824bf0e95029d6","observation_id":"4d673733-08c1-4cc5-85e1-c3dc09dff0a5","resolution":{"observed_at":"2026-05-23T16:35:42.170256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-10T14:29:27.951706Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15269","last_updated":"2025-01-25T16:36:00Z","snapshot_observed_at":"2026-08-10T14:24:39.343710Z","submitted_at":"2025-01-25T16:36:00Z","title":"Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:29:27.951706Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2501.15269"},"observation_digest":"sha256:af89348cdb12c4cf58cffe971c47fbf7fa61cd3b34124e0a3b1763cf651731a0","observation_id":"a6e18ee9-723c-42ce-ae64-2d9d3a993120","resolution":{"observed_at":"2026-08-10T14:29:27.951706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-09T15:04:40.290744Z","title":"Multimodal-GPT: A vision and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.290744Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:cee937e67d10a6aeab8e32e0cd65fa902179cce502515e9abc2e6d724b4e8a8e","observation_id":"b78d3394-86f5-4115-8bee-1f12f53155fc","resolution":{"observed_at":"2026-08-09T15:04:40.290744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2505.17015","last_updated":"2026-05-22T13:26:59Z","snapshot_observed_at":"2026-08-02T12:28:29.672279Z","submitted_at":"2025-05-22T17:59:39Z","title":"Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T08:38:02.944230Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2505.17015"},"observation_digest":"sha256:74e194cf9ce1e9172a90da3ecb8a740941c0acae65a3070c59dcb69385ef8339","observation_id":"088ced41-4caf-4971-9b92-5c631bac88c9","resolution":{"observed_at":"2026-05-25T08:40:33.039816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-07T14:37:48.592607Z","title":"Multimodal-gpt: A vision and lan- guage model for dialogue with humans.arXiv preprint arXiv:2305.04790, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.592607Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1615ee9fb8c1682c5772b21f3f6de3fa096cf3fe3722edfacaefa293a1267b2a","observation_id":"b6714ece-d05d-4107-9b94-f2872aac866a","resolution":{"observed_at":"2026-08-07T14:37:48.592607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:dac90e668bbf8c5d80ce7e2593b6411c8896d35d498ad91dedb340628ddc3865","observation_id":"2292cf2d-e482-49cd-afe2-1bcd858ada29","resolution":{"observed_at":"2026-05-19T11:52:16.397197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2506.13130","last_updated":"2026-04-05T18:57:23Z","snapshot_observed_at":"2026-08-01T06:52:29.993140Z","submitted_at":"2025-06-16T06:27:59Z","title":"ZINA: Multimodal Fine-grained Hallucination Detection and Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T10:07:18.162776Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2506.13130"},"observation_digest":"sha256:f9948cecf27d8c1da0eb1f270bed15c8b846a00e40d0914bd37b809311f33fbb","observation_id":"45aeee9e-f93b-48e0-8059-9d25601cfaa0","resolution":{"observed_at":"2026-05-19T10:12:14.614209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-06T23:34:55.367724Z","title":"arXiv preprint arXiv:2305.04790","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17664","last_updated":"2025-06-21T09:49:16Z","snapshot_observed_at":"2026-08-10T00:52:47.417318Z","submitted_at":"2025-06-21T09:49:16Z","title":"MDSAM:Memory-Driven Sparse Attention Matrix for LVLMs Hallucination Mitigation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:55.367724Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2506.17664"},"observation_digest":"sha256:45863bba701f39c1e9a1383472a05db5e5677bfd75eaea26e9a08050b661bbac","observation_id":"400765dc-0cac-40bc-a2aa-1021cce2aab4","resolution":{"observed_at":"2026-08-06T23:34:55.367724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-06T20:58:56.603817Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01438","last_updated":"2025-07-02T07:47:28Z","snapshot_observed_at":"2026-08-10T12:39:07.196333Z","submitted_at":"2025-07-02T07:47:28Z","title":"EdgeLoRA: An Efficient Multi-Tenant LLM Serving System on Edge Devices","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:56.603817Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2507.01438"},"observation_digest":"sha256:6bbb826752ae551286fa4c8618ae75ac4e44d054dc9ff9ee0f1385b8f4acdfc3","observation_id":"dc773c05-af7f-483e-8f26-a00cc3dd7477","resolution":{"observed_at":"2026-08-06T20:58:56.603817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-06T16:42:13.222612Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12916","last_updated":"2025-07-17T09:02:04Z","snapshot_observed_at":"2026-08-08T23:17:21.852300Z","submitted_at":"2025-07-17T09:02:04Z","title":"Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:13.222612Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2507.12916"},"observation_digest":"sha256:761d405ccd0cd55c91cf73b89dfd43fb93a3c42865332908663430f6b2f1456b","observation_id":"5a8ca3ef-4922-450f-8dbc-eab82778dc6d","resolution":{"observed_at":"2026-08-06T16:42:13.222612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-06T05:15:41.699694Z","title":"Multimodal-gpt: A vision and lan- guage model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-08T15:06:07.047501Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:41.699694Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:03ce7bf404080f4affec73ae2d1720d94601d98150091571881f4ac8f08a326b","observation_id":"a17860a5-add1-408d-b48d-f976276139fc","resolution":{"observed_at":"2026-08-06T05:15:41.699694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-06T05:12:34.629056Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.629056Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:0a71e13ab0681503801c1cae6860512095d038792eb3e74fba881e7987c80591","observation_id":"c873d276-6d9c-4465-aca0-e444a94ae04b","resolution":{"observed_at":"2026-08-06T05:12:34.629056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-04T12:27:28.673021Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03520","last_updated":"2026-06-10T17:21:57Z","snapshot_observed_at":"2026-08-07T07:08:30.567791Z","submitted_at":"2025-10-03T21:24:41Z","title":"Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T12:27:28.673021Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2510.03520"},"observation_digest":"sha256:fafb493d565fd21e17b9f348bbc76c813d7f7275becfdf3162f76c1c2e714079","observation_id":"108f2783-adb1-4ad8-bd18-b35c1718fbf9","resolution":{"observed_at":"2026-08-04T12:27:28.673021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:696b9655fcc5bdb91f8cd5e359f506c52c44779f004a70d53edcf23c883fb924","observation_id":"8a31ba8f-7f14-441b-b87f-39e522c77927","resolution":{"observed_at":"2026-07-04T06:39:37.434747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-01T07:12:17.569658Z","title":"arXiv preprint arXiv:2305.04790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.569658Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:40e61a615c37adc3f93a5897e7faa85f3c10e8aab519dc6f0f1ad174602e25fb","observation_id":"149b6ae8-df44-46f2-b627-27211285b6a6","resolution":{"observed_at":"2026-08-01T07:12:17.569658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.04790/citation-record","integrity":"/paper/2305.04790/integrity","json":"/paper/2305.04790/citation-record.json","paper":"/paper/2305.04790"},"outbound":[],"paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2305.04790."}