{"as_of":"2026-08-13T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27da5742b7a3c608bddcce904389f60a38bd01375d75ff1db6c15e50e34ca936","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:42:55.863310Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:36.858275Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":276,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:3df05805faa208a04a9207fae89e029ac90d8ca8b5442386cbc00c825913705f","observation_id":"823baf9b-99e4-45d8-b4a8-ebcf608cccb8","resolution":{"observed_at":"2026-05-19T20:28:39.232881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T02:29:46.242983Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2310.13289"},"observation_digest":"sha256:f4b81a4ecedf8742fcc10ebf01e43395f69a093817975a4bdc0d64af483aab80","observation_id":"7ec90a18-15d0-4e14-9d2d-7b78253eb0e9","resolution":{"observed_at":"2026-05-18T02:29:46.301213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:bdcdd494dbbebcf3454f934b45df13b26aa4a348dbebc746fecbf03732679110","observation_id":"0e5f935e-91f7-42dd-90d9-b091d4afbb92","resolution":{"observed_at":"2026-05-12T18:57:28.813519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-14T18:08:01.166072Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2311.10122"},"observation_digest":"sha256:bf9c0b6a5fefb7c51b60dfeae6208adf74dc72c9f09af22818d16b96f80fb391","observation_id":"7b24515a-5acf-4e75-a8b7-b3aa0fb5913f","resolution":{"observed_at":"2026-05-14T18:08:01.403062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"reference_index":276,"source":"arxiv_source","source_observed_at":"2026-05-17T23:31:11.213552Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2402.13116"},"observation_digest":"sha256:b5c1ced2e5c8b3de20428d06708024f17376a028e03e004541e452282507eab8","observation_id":"ad33c919-b2e0-490e-b34f-1e843972964e","resolution":{"observed_at":"2026-05-17T23:31:11.548038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:091544bbbb3f15db1aee6b6b5964656fced9793b6f1680771ac14c41fa89291a","observation_id":"30c2f2c9-ce19-4796-86ea-c2a2cc9622a9","resolution":{"observed_at":"2026-05-11T02:44:53.563909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-13T05:33:22.244747Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:14:45.371564Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2407.10759"},"observation_digest":"sha256:f73e125a2b42fbb691b052c9c5b1dbc672e906531487e713086d8ed726c33a84","observation_id":"28e4e6ba-cd82-4061-bf6e-e8e2816bf183","resolution":{"observed_at":"2026-05-11T02:14:45.433296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-12T16:42:55.863310Z","title":"Macaw-llm: Multi-modal language model- ing with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13281","last_updated":"2025-03-23T11:01:22Z","snapshot_observed_at":"2026-08-12T23:07:06.477974Z","submitted_at":"2024-11-20T12:48:34Z","title":"VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:42:55.863310Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2411.13281"},"observation_digest":"sha256:880cd3d53f569aea39c5e3ec9f6821fd34084cbb9fc71095352c49c258a61f39","observation_id":"13e645a2-f7ef-4f9f-9aaa-37e1ece1f7f5","resolution":{"observed_at":"2026-08-12T16:42:55.863310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-12T11:24:15.821992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-12T22:00:39.568139Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.821992Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:b7d0494683833bb1a839c4a910f3fa46e5c7b18f2a3e6d96e40d7c5bbc41db97","observation_id":"a8ef66c2-02cb-486c-9647-a1d08d3bf058","resolution":{"observed_at":"2026-08-12T11:24:15.821992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-12T11:03:01.156959Z","title":"Macaw-llm: Multi-modal language modeling with im- age, audio, video, and text integration.arXiv preprint arXiv:2306.09093, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18688","last_updated":"2025-06-14T04:20:06Z","snapshot_observed_at":"2026-08-12T10:56:39.039288Z","submitted_at":"2024-11-27T19:00:10Z","title":"Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:03:01.156959Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2411.18688"},"observation_digest":"sha256:0b29686fa9c3065fb6baf3c461b5cc57156d1081d1b479d6dbda049ebb7ed0bc","observation_id":"4887de70-e6f4-4902-baa1-d5453fe20896","resolution":{"observed_at":"2026-08-12T11:03:01.156959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-12T05:53:35.521331Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration.arXiv preprint arXiv:2306.09093, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19772","last_updated":"2025-03-20T11:55:30Z","snapshot_observed_at":"2026-08-12T14:43:22.247523Z","submitted_at":"2024-11-29T15:18:06Z","title":"LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:53:35.521331Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2411.19772"},"observation_digest":"sha256:590d4719366119a0b8e6c6e8d74f0f849170aa473ab2211602b85872a5468114","observation_id":"429c8830-9c4d-48ff-8009-9d3edca87c9f","resolution":{"observed_at":"2026-08-12T05:53:35.521331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T23:50:37.060329Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration.arXiv preprint arXiv:2306.09093, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02158","last_updated":"2024-12-04T08:34:49Z","snapshot_observed_at":"2026-08-12T14:25:50.767875Z","submitted_at":"2024-12-03T04:34:23Z","title":"Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:37.060329Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.02158"},"observation_digest":"sha256:df921fba500a572c20a245050b110139a4042662a90e9ae063f35addb93dbb6a","observation_id":"c420b547-a927-4ac1-bd3b-e5702a8bc775","resolution":{"observed_at":"2026-08-11T23:50:37.060329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T19:31:43.909252Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-13T09:14:45.905037Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T19:31:43.909252Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.06660"},"observation_digest":"sha256:23c62e86c4f86da1c13bb896c0a1719c3456fe7cd2f00e3a096fd517b6a9ee85","observation_id":"919c5fa8-8e2c-4e6f-bb69-deb37b4425b7","resolution":{"observed_at":"2026-08-11T19:31:43.909252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T18:10:44.701645Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10435","last_updated":"2025-07-02T21:50:59Z","snapshot_observed_at":"2026-08-11T18:04:50.891939Z","submitted_at":"2024-12-11T08:10:32Z","title":"COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:10:44.701645Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.10435"},"observation_digest":"sha256:c88435fec300cf3fc868e4de6b772e3eb4adee6d608823bc275845a531af6810","observation_id":"5b249fd0-068e-4b75-bffc-eaebaeb45630","resolution":{"observed_at":"2026-08-11T18:10:44.701645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T13:53:57.963829Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.963829Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:19d6fe9056e46446b3d9b5e1c53e42ab5d626c69e58a4d1ccbb316a5e2e2d1c2","observation_id":"48293247-e7f6-4c2a-bdf6-243e10c9548f","resolution":{"observed_at":"2026-08-11T13:53:57.963829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T12:47:17.600128Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13845","last_updated":"2025-02-24T03:37:59Z","snapshot_observed_at":"2026-08-11T14:35:32.643550Z","submitted_at":"2024-12-18T13:38:06Z","title":"Do Language Models Understand Time?","version":3},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-11T12:47:17.600128Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.13845"},"observation_digest":"sha256:56c598cc375ccb55acf6b28bb58c7bbfa9e941025212e3a03b56d09e8956cdb5","observation_id":"16db6505-2dae-4e84-948d-f0a13e6764e3","resolution":{"observed_at":"2026-08-11T12:47:17.600128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T11:48:07.195569Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T22:40:27.835458Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.195569Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c01cc940a2dba64ac54d23aa7e7b9b8a9d08192577eb1d45aa7e767e07fd67f7","observation_id":"96e9d748-0816-492a-909a-bb559c1a83cb","resolution":{"observed_at":"2026-08-11T11:48:07.195569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T10:33:19.087751Z","title":"Macaw-llm: Multi-modal language model- ing with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16524","last_updated":"2024-12-21T08:01:08Z","snapshot_observed_at":"2026-08-13T05:49:39.933557Z","submitted_at":"2024-12-21T08:01:08Z","title":"LLaVA-SLT: Visual Language Tuning for Sign Language Translation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T10:33:19.087751Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.16524"},"observation_digest":"sha256:92ee285d2ae36edac67dd040c0281eb942f73b3b8b11f10946b365f1a053e3de","observation_id":"3e6ff04f-c89d-4cb7-8c50-d03424393eec","resolution":{"observed_at":"2026-08-11T10:33:19.087751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T14:59:02.400857Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":286,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:02.400857Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:aec53514f66e08fd6b13e7645a52770c1201a3a0a5a32a254985f52020cb2680","observation_id":"063239ca-0fa4-48cb-92ed-e7111298b7ca","resolution":{"observed_at":"2026-08-11T14:59:02.400857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-10T22:19:53.425889Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02135","last_updated":"2025-01-03T23:03:24Z","snapshot_observed_at":"2026-08-10T23:06:48.073542Z","submitted_at":"2025-01-03T23:03:24Z","title":"AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:53.425889Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2501.02135"},"observation_digest":"sha256:98f26aab8dab0ace08e0706a0c56c4028bc64f6f4d279b0317e955903401d2aa","observation_id":"046aa89c-25ba-4ade-95a3-63c3f3156b1d","resolution":{"observed_at":"2026-08-10T22:19:53.425889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:62b1e716e6717c7b82008a74d4546584c2f76142beda6ae3be61c5715a6c9335","observation_id":"b1d4f467-c679-43d6-8722-c23eee022818","resolution":{"observed_at":"2026-05-11T01:20:00.167570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-10T14:46:38.518573Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15014","last_updated":"2025-01-28T20:29:44Z","snapshot_observed_at":"2026-08-13T04:12:11.582628Z","submitted_at":"2025-01-25T01:37:03Z","title":"On Accelerating Edge AI: Optimizing Resource-Constrained Environments","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-10T14:46:38.518573Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2501.15014"},"observation_digest":"sha256:faa2781b41fe67bed47c68d045182a4cf842933ce374a703ef1f2edd23afeeff","observation_id":"d30c24d8-bc1b-46e8-9270-fae6bbfed8e2","resolution":{"observed_at":"2026-08-10T14:46:38.518573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-08T22:00:02.128524Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06846","last_updated":"2025-05-22T09:43:36Z","snapshot_observed_at":"2026-08-10T01:40:37.952377Z","submitted_at":"2025-02-07T05:23:16Z","title":"Prot2Chat: Protein LLM with Early-Fusion of Text, Sequence and Structure","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T22:00:02.128524Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2502.06846"},"observation_digest":"sha256:72390022e52705badb925ace98bced51e0da2bddf6375080025ecd17dd2066a6","observation_id":"73ecf23a-b354-4599-b8f9-848ec14743a3","resolution":{"observed_at":"2026-08-08T22:00:02.128524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:a9ab535c5e63bc749e4db6fee209a3ecad85c01669f315cddfba0f23207aef88","observation_id":"aa34a99f-d3d2-4a41-9b78-3d9ae8641cc2","resolution":{"observed_at":"2026-05-16T15:04:22.863381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T15:22:51.818382Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17110","last_updated":"2025-05-21T12:40:07Z","snapshot_observed_at":"2026-08-08T23:15:34.725731Z","submitted_at":"2025-05-21T12:40:07Z","title":"Multi-Modality Expansion and Retention for LLMs through Parameter Merging and Decoupling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:22:51.818382Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2505.17110"},"observation_digest":"sha256:93500537740b86c37ca927e9da8e12d36dbde004d1dade47457d1735ec903ab3","observation_id":"ccf98728-886e-4412-91c8-124834cf70be","resolution":{"observed_at":"2026-08-07T15:22:51.818382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T15:19:13.241354Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-12T22:03:11.208135Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.241354Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:581e99ef426868f2d63c8d946e06952c4d827f6305c2085190c72ca7cdde6396","observation_id":"32b933df-fe53-445c-b865-a4551977dff5","resolution":{"observed_at":"2026-08-07T15:19:13.241354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T14:06:49.900006Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-13T09:07:16.568614Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.900006Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:789b863309d8d2f74b569d4e0d5b06e7cf281386f058cf90fa371074c505f80a","observation_id":"5f486cbc-df12-485f-8dc2-8c4e544ab8ae","resolution":{"observed_at":"2026-08-07T14:06:49.900006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T12:45:47.443705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-12T14:38:08.894823Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.443705Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:f8071ac6cad835f396009049c5df0389e3ec121653f5049e4b3208da55aed748","observation_id":"e30ebd95-91dd-4632-90e8-d9560d30dc93","resolution":{"observed_at":"2026-08-07T12:45:47.443705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T04:34:05.315938Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.315938Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:7a6a46fa1f2c99343d860c7b1eaeda450c1a13442d815aa3ce5d05fcd4d20f8b","observation_id":"87ae0daa-a108-4529-bfcc-022c9b0aa4aa","resolution":{"observed_at":"2026-08-07T04:34:05.315938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-06T14:36:29.101479Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.101479Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:7e0340127550fa67c0af6444215516289a727f37b1ee3ddecbd990bf8584f166","observation_id":"9a5d55e2-8499-4997-8b8f-7e832017e2e5","resolution":{"observed_at":"2026-08-06T14:36:29.101479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-05T21:53:41.142189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07759","last_updated":"2025-08-11T08:42:49Z","snapshot_observed_at":"2026-08-09T15:03:58.455667Z","submitted_at":"2025-08-11T08:42:49Z","title":"Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:53:41.142189Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2508.07759"},"observation_digest":"sha256:ad90bc0d316b550c41e8699ba77a22f169db5b320450fce7a1ae39d30e23f9b3","observation_id":"305d6246-9c3d-4e12-9b2e-2d285b1f1c53","resolution":{"observed_at":"2026-08-05T21:53:41.142189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-05T10:16:04.842954Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04392","last_updated":"2025-09-04T17:03:58Z","snapshot_observed_at":"2026-08-09T12:04:37.130962Z","submitted_at":"2025-09-04T17:03:58Z","title":"Denoising GER: A Noise-Robust Generative Error Correction with LLM for Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:04.842954Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2509.04392"},"observation_digest":"sha256:fd4ee937b7e3a2d7474afd9719c54eb5ec865ebcd10e1d733d8589a1feb0f507","observation_id":"41bc5a63-d4dc-4a4d-8689-e30e4d35f1c7","resolution":{"observed_at":"2026-08-05T10:16:04.842954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-05T06:00:27.493319Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.493319Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:461b317926acd4cd922d8842029a5106d1a6dd4ec5ea78b8257cfb1ed0fb4f55","observation_id":"99f01e68-3340-4ab5-be81-98fc9dd23528","resolution":{"observed_at":"2026-08-05T06:00:27.493319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2604.02605","last_updated":"2026-04-03T00:48:49Z","snapshot_observed_at":"2026-07-31T12:45:01.220506Z","submitted_at":"2026-04-03T00:48:49Z","title":"Do Audio-Visual Large Language Models Really See and Hear?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:19.815569Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2604.02605"},"observation_digest":"sha256:6091efc85e1bd0f7779a5102998652f8c73bc0a4201166aa1fdb34eb55645406","observation_id":"565bc1bb-94cb-4716-b693-4adbfc77deef","resolution":{"observed_at":"2026-05-13T20:58:15.851160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0d93f5d718b1765e83390b263482ba59e07f38423ae85ae47c2ac174e0c512bd","observation_id":"9ccff55d-a74e-44fa-bf18-f15ea7a9eb21","resolution":{"observed_at":"2026-05-11T08:30:57.005963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:05:06.936268Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:82dac033674a359e8708bb9f5f7ac91d0115f8afda66bec888cbfd1f77f68518","observation_id":"392c5b56-99bb-4e23-8187-94a85e5596c2","resolution":{"observed_at":"2026-05-12T06:41:30.476568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:c7663a6361d1f3f9cf8af890fcdc21f29a62a7865ea2ffd805686ca01d3b080e","observation_id":"26ee8227-5eea-45f8-9223-3cd80b427a22","resolution":{"observed_at":"2026-05-13T03:07:08.701574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:143403965f40c866561ef06df39d62b7ada44e7fd7125cda18ac41fb5a7c4433","observation_id":"1dffdf43-1dd2-4240-b85f-02f3f24bb3b2","resolution":{"observed_at":"2026-05-13T02:02:06.307495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2606.09966","last_updated":"2026-06-08T16:29:59Z","snapshot_observed_at":"2026-08-08T03:15:29.403995Z","submitted_at":"2026-06-08T16:29:59Z","title":"RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T15:05:31.609683Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2606.09966"},"observation_digest":"sha256:dd06bed6f005456e68b7cc7063fc71234ad8d5cfc8438f84f2603974b05084d0","observation_id":"5c35675c-944a-4554-a864-3b07115dcaba","resolution":{"observed_at":"2026-07-03T03:37:35.647140Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2606.10533","last_updated":"2026-06-09T08:04:06Z","snapshot_observed_at":"2026-08-05T15:31:34.855440Z","submitted_at":"2026-06-09T08:04:06Z","title":"Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T13:53:53.520545Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2606.10533"},"observation_digest":"sha256:a38620e5373c56673bc3fb994260839f304d4241ff936bc5e4535dbc6c7a7677","observation_id":"de0d9acc-9854-4560-b490-5baf8474ba19","resolution":{"observed_at":"2026-07-03T04:27:36.859688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2306.09093/citation-record","integrity":"/paper/2306.09093/integrity","json":"/paper/2306.09093/citation-record.json","paper":"/paper/2306.09093"},"outbound":[],"paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2306.09093."}