{"as_of":"2026-08-13T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3f1c5e03eea6b22143f5113876faa37fc7b1685c18ceca4de7ae07607fe97df","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:33:30.363072Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14137/citation-record","integrity":"/paper/2411.14137/integrity","json":"/paper/2411.14137/citation-record.json","paper":"/paper/2411.14137"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05315","last_updated":"2024-12-01T06:49:31Z","snapshot_observed_at":"2026-08-12T05:03:37.161929Z","submitted_at":"2024-12-01T06:49:31Z","title":"Text Is Not All You Need: Multimodal Prompting Helps LLMs Understand Humor","version":1},"cited_work":{"arxiv_id":"2412.05315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05315","snapshot_observed_at":"2026-08-12T15:33:30.883685Z","title":"Text Is Not All You Need: Multimodal Prompting Helps LLMs Understand Humor","venue":"cs.CL","work_id":"acb3c97a-3d41-457a-ad0e-74854b94f257","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.491407Z"},"links":{"cited_paper":"/paper/2412.05315","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:bdf761b4cfb05378e4bd33a51e654cbdf26f99f07d6884e9811d5d47f66efa2f","observation_id":"0725f70a-b521-4fa7-a790-7e563d81a0a5","resolution":{"observed_at":"2026-08-12T15:33:30.939571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.290829Z","title":"Improv- ing image generation with better captions","venue":null,"work_id":"1e25208b-9b33-4c26-9fc9-216b35693231","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.529684Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:f4b92cfda6e120aabbf90602882b0b6277acd5c4e0ef90e0454a88ef08708ba3","observation_id":"6509cdc8-b1db-471e-ae37-2a63dbf15b71","resolution":{"observed_at":"2026-08-12T15:33:33.367661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.142393Z","title":"Explicit modelling of theory of mind for belief prediction in nonverbal social interactions","venue":null,"work_id":"ecdca5e8-a1a2-48bc-b964-7b3f8aae9b90","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.580876Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:8d9e047c193f8b0d38af9ce17faddf3bf33ab54261fb49626c26b43c4a9a27bc","observation_id":"4fcbfafb-4a7c-468f-9b6f-ee5a58a999be","resolution":{"observed_at":"2026-08-12T15:33:33.213492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.130037Z","title":"FLUTE: Figurative language understand- ing through textual explanations","venue":null,"work_id":"c8a5ea60-ecc0-466b-b3f6-785fd2204fab","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.596552Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:758ef1642d67a032020b70de3030551d1adcc2e6ac934a8391cdd52bd4584c2d","observation_id":"e703c411-b4c2-44c3-b556-8df40b437cde","resolution":{"observed_at":"2026-08-12T15:33:33.134512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.648994Z","title":"Through the theory of mind’s eye: Reading minds with multimodal video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.648994Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:73345a2b9393191d13d96bb2abcdc11a5684bbd03aaedb9b898f851f8a840d7b","observation_id":"3bed0c64-0023-4bc1-9a7a-5629e3bb8d32","resolution":{"observed_at":"2026-08-12T15:33:28.648994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T15:33:28.683777Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.683777Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:7269186b9886bcccb5d94f4b39919b559e3765cf5f68ebf62555c1ddcafcabae","observation_id":"076bcb41-30e8-4181-8095-28dfe22918c9","resolution":{"observed_at":"2026-08-12T15:33:28.683777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.112000Z","title":"The limitations of large language models for understanding human language and cognition","venue":null,"work_id":"14d590e1-32f2-4799-8ebd-364f89fc6f35","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.731726Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:1f52ae6795c568ddf1c0fc9f130090d0eac9063646cc09f1fd2cd764eb212b4f","observation_id":"ae2b0df4-b8e5-4646-a0bc-6b4ad9ea0a27","resolution":{"observed_at":"2026-08-12T15:33:33.115698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.101188Z","title":"Docmsu: A comprehensive benchmark for document- level multimodal sarcasm understanding","venue":null,"work_id":"1982a107-9451-4192-9978-567fc08cb3d8","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.784948Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b44c9475fb909bcfd1f94b6c9b9c4f2f007b1dcdd04bfd258128668af53d74a5","observation_id":"50da5126-56f0-4f38-a2bd-ac5fe18a9868","resolution":{"observed_at":"2026-08-12T15:33:33.104945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10665","last_updated":"2022-06-21T18:29:17Z","snapshot_observed_at":"2026-07-06T13:23:18.665282Z","submitted_at":"2022-06-21T18:29:17Z","title":"BOSS: A Benchmark for Human Belief Prediction in Object-context Scenarios","version":1},"cited_work":{"arxiv_id":"2206.10665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.10665","snapshot_observed_at":"2026-08-12T15:33:30.723876Z","title":"BOSS: A Benchmark for Human Belief Prediction in Object-context Scenarios","venue":"cs.CV","work_id":"634eafea-3da8-4b0b-96ef-6d258d9f6b65","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.837774Z"},"links":{"cited_paper":"/paper/2206.10665","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:7baf1433a8884d6ccece24c852cf8bc80954b9741e956533de9c7728181e3270","observation_id":"888c766c-645b-4fa7-b65a-d6f0dca1cf52","resolution":{"observed_at":"2026-08-12T15:33:30.742152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.088653Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":"311782fe-90ee-4bfb-ad1d-3a7cea4c5ff7","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.863690Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:894e242e6ce3637a30c6e1555bef3034c681a77817ef1d31842b81385f088422","observation_id":"6a8363b7-6d8e-4f6e-a481-c3aa7310b7f9","resolution":{"observed_at":"2026-08-12T15:33:33.092537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.076942Z","title":null,"venue":null,"work_id":"f79a4354-852a-4905-a85d-a0d07135e868","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.894133Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b845ace18a444bf0f4b9ad578358a2404290fb19f9b928bd71bcb73d3cfdff67","observation_id":"474b4c43-8531-4f92-b1f5-495d965d8294","resolution":{"observed_at":"2026-08-12T15:33:33.080854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T15:33:28.903052Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.903052Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b1ee50e4a5dbac33a7b701c5f80aa9b6a3486a9f619f84f9598d4cb0b5d144a1","observation_id":"d565480c-4a1b-4889-b6c8-9989c5576a98","resolution":{"observed_at":"2026-08-12T15:33:28.903052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.028928Z","title":"UR-FUNNY: A multimodal language dataset for understanding humor","venue":null,"work_id":"bd8cd053-6c4e-4528-a19e-0b11ef602aea","year":2019},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.941400Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:5fc86daee6acbe2c3ceb13116eb7f94f907adfa7b99d285ec62c6a9faf79c0b8","observation_id":"b6b50aad-7f55-4664-8295-391da868bac1","resolution":{"observed_at":"2026-08-12T15:33:33.069211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.738860Z","title":"understanding","venue":null,"work_id":"6407294a-440a-4c4a-8b78-d53739323743","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.002772Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:c77d14f2b786603c73847844f339514dd158f97a21a1ea85f593b7aa783e4979","observation_id":"a2125613-fafd-4ba1-b62f-c8a089fbd807","resolution":{"observed_at":"2026-08-12T15:33:32.872512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13703","last_updated":"2023-05-23T05:41:18Z","snapshot_observed_at":"2026-08-10T17:50:13.474873Z","submitted_at":"2023-05-23T05:41:18Z","title":"MemeCap: A Dataset for Captioning and Interpreting Memes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13703","snapshot_observed_at":"2026-08-12T15:33:29.062742Z","title":"Memecap: A dataset for captioning and interpreting memes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.062742Z"},"links":{"cited_paper":"/paper/2305.13703","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:5785a48334920f4c91f4471c2f66c31af711090d2a74f37afc403815ea15305b","observation_id":"896b2410-579c-4b57-acec-8ded9fbcba2b","resolution":{"observed_at":"2026-08-12T15:33:29.062742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09899","last_updated":"2024-01-18T11:24:30Z","snapshot_observed_at":"2026-08-13T04:39:57.049504Z","submitted_at":"2024-01-18T11:24:30Z","title":"Meme-ingful Analysis: Enhanced Understanding of Cyberbullying in Memes Through Multimodal Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09899","snapshot_observed_at":"2026-08-12T15:33:29.128578Z","title":"Meme-ingful analysis: Enhanced understanding of cyberbullying in memes through multimodal explanations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.128578Z"},"links":{"cited_paper":"/paper/2401.09899","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:16e17378e98a57c0aa6bd2ae22ec8eba20d7b17403ad7b38563b7ff3c668550e","observation_id":"02042789-40c8-494c-84e2-5f290b674e13","resolution":{"observed_at":"2026-08-12T15:33:29.128578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.658176Z","title":"MMToM-QA: Mul- timodal theory of mind question answering","venue":null,"work_id":"a179c593-7718-441e-aea8-ec6e5581ae94","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.161723Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:59f2534257def66612256d4239fc007ac750e2876ae24be3147663f707e24116","observation_id":"ee465fe2-afb8-4954-bf46-a44d9d94c6a4","resolution":{"observed_at":"2026-08-12T15:33:32.663428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.643468Z","title":"Yolov11: An overview of the key architectural enhancements, 2024","venue":null,"work_id":"a77d0e28-cdc5-4bbd-a798-9900012e9489","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.174933Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:dec955ccb3861cbcbe31b8e06e5774c3006224603dc6f111b0101e4d2fbfdf96","observation_id":"7d2953d2-7611-4b2f-a6d3-92410c0da2ce","resolution":{"observed_at":"2026-08-12T15:33:32.647468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.630690Z","title":"When did you become so smart, oh wise one?! sarcasm explanation in multi-modal multi-party dia- logues","venue":null,"work_id":"01dcb588-53e8-435b-ba3e-145ae79066cb","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.183698Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:059834687395b8acfcecc3320c14a2adf9b1d75a1497cdbc73c30686569ae9c6","observation_id":"f2e92296-a41c-4d75-aff4-f75c8418537a","resolution":{"observed_at":"2026-08-12T15:33:32.635641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.615161Z","title":"Explaining (sarcastic) utterances to enhance affect understanding in multimodal dialogues","venue":null,"work_id":"64d9c0dc-53eb-464e-a06c-86645d70c33a","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.188496Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:00e4e8ae923f02dbe3e8721ab3bb7b7d5ac200cabc01a143cd65bce7ccd83daa","observation_id":"5c2e77f2-115f-420c-b3ed-7cba9a6afc8f","resolution":{"observed_at":"2026-08-12T15:33:32.620029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.602116Z","title":"SBU figures it out: Models explain figurative language","venue":null,"work_id":"0db99172-4d04-4352-8c51-57d397087d5d","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.236407Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:80d4e6fafc1c7f0c0025aecb76deecdce70f384f168e097f15b7fb79fde3fe59","observation_id":"edf4a422-c6cd-41d2-a83e-3a6376b6ca47","resolution":{"observed_at":"2026-08-12T15:33:32.606123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.587557Z","title":"What matters when building vision-language mod- els? Advances in Neural Information Processing Systems, 37: 87874–87907, 2025","venue":null,"work_id":"937b3000-c255-4e99-a0b5-0d6f52da188c","year":2025},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.296501Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:447fdb695ca854e49d1d395161dbe4cc968ffdb8479a7719a98bcd8558fa2f10","observation_id":"b50fce51-3132-453c-a6df-1805cb831506","resolution":{"observed_at":"2026-08-12T15:33:32.592531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T15:33:29.352196Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.352196Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:176a21be15fe013cb4a43b33176bac1c241e834f1221600974d0b9bc68fe066a","observation_id":"bc88d951-6b2d-4ede-8489-658ff5da0aca","resolution":{"observed_at":"2026-08-12T15:33:29.352196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.573075Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models, 2024","venue":null,"work_id":"1848c114-5bfe-49b4-b172-9cb9a314453f","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.380370Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:99a6edb2f08ded334bc5bda0fccf9d509c75f131fe5c3d9c0d159c18aebd8e0a","observation_id":"10067569-cc7f-454c-a399-5167e453cc4f","resolution":{"observed_at":"2026-08-12T15:33:32.578291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.364779Z","title":"Li, Sachin Goyal, Joao D","venue":null,"work_id":"94fdd25c-c0bd-49d0-8da8-6b6db8e5dd1b","year":2025},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.387804Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:3d6aac17904a489fad354b67d124a9cf899a6c2621f902b68ed583f7dcf3ea44","observation_id":"3e0280d9-2206-46db-bbdf-f65036490f6b","resolution":{"observed_at":"2026-08-12T15:33:32.464510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.173104Z","title":"Lawrence Zitnick","venue":null,"work_id":"61effcd1-f0a5-40de-9aee-5b60bf74a9ef","year":2014},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.391473Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:9ccf72d7b7a8b98b39eeba45a810345a0e1c98546618efa5afd4ed1c421e4296","observation_id":"372eb27f-ab0c-4fdd-9d65-451b9964e9c0","resolution":{"observed_at":"2026-08-12T15:33:32.247970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.160759Z","title":"I’d rather just go to bed","venue":null,"work_id":"6c397a28-5dab-4e52-b378-1e9dc872dfb1","year":2020},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.395979Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:6bb07af98626748a889f9caa5bd312f507209aa61c91ec1d1a35fd6bb39e843e","observation_id":"62148796-817b-4784-8359-2d4067a3e572","resolution":{"observed_at":"2026-08-12T15:33:32.164843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-12T23:53:21.822871Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:33:29.453481Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.453481Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:48c8178267df383866a4ff3e93a156a240feb969f4858abf4d703a07ba410672","observation_id":"4a30158a-bbd4-454f-a035-56074b10d43a","resolution":{"observed_at":"2026-08-12T15:33:29.453481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.146848Z","title":"Phi-3 technical report: A highly capable language model locally on your phone, 2024","venue":null,"work_id":"faee1521-3e5c-4ab5-8c9d-65e0f632debb","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.516333Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:2e213d165dfcc8c421ab3908fd4a04de4202485b8526b739dd8c74b9285aebaa","observation_id":"e4966893-9e12-4ab7-b0d4-2a9fdff21652","resolution":{"observed_at":"2026-08-12T15:33:32.151042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.134182Z","title":"What is the real intention behind this question? dataset collec- tion and intention classification","venue":null,"work_id":"1828c9bc-1ccc-4fc0-b48c-40426b9f62d9","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.560220Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:c94b7197afc3d478bbe9304a4aa23aca5e823ae14aae9a1499c4138514a768a4","observation_id":"374a0525-13a6-45ab-95cb-9deafafa9a8b","resolution":{"observed_at":"2026-08-12T15:33:32.138482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T15:33:29.629289Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.629289Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:48ff992739652d7a1bd00329c194f583f42fae5c15f9928089e5ee10860af500","observation_id":"5cf83a1b-4209-40bf-8ef6-5ead41dd6743","resolution":{"observed_at":"2026-08-12T15:33:29.629289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:29.680192Z","title":"Sentiment-enhanced graph-based sarcasm explanation in dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.680192Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:1bae6e4882350b82f31021f5cc7141a2a959a3a1e111900143788f765551b32a","observation_id":"8a9a8a9b-61e0-43c1-a99c-c31f6d4b938c","resolution":{"observed_at":"2026-08-12T15:33:29.680192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.123454Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"f53a5b01-0cb4-47d1-86d0-06b984b16c8e","year":2002},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.722538Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:119faa068bf14f9be4c596b9b719167991c8bbfcf957c45b02051bfb5e1d660d","observation_id":"a71c14b5-927e-419c-b450-4b29876865ab","resolution":{"observed_at":"2026-08-12T15:33:32.127003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.111739Z","title":"Does the chimpanzee have a theory of mind? Behavioral and brain sciences, 1(4): 515–526, 1978","venue":null,"work_id":"ff2023d2-61ef-4fbc-b914-9ca01c49236a","year":1978},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.739926Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b32988419ccc79aac53eebe2e9d99fa70a680fbf5ff88dd29f404897caba981a","observation_id":"98702e3a-598d-45b7-83dc-41c4cfa640c1","resolution":{"observed_at":"2026-08-12T15:33:32.116069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.097378Z","title":"Movie description","venue":null,"work_id":"03038900-ed6a-4359-8b63-6a36490fb27c","year":2017},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.745047Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:8fffeaf3fce7420f67145dcd1176d1bd93cc7e3dcc35fb40468f00fa92bdbc7b","observation_id":"aebe7f45-fbbd-4a84-bccd-8936be49e26b","resolution":{"observed_at":"2026-08-12T15:33:32.102046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.085829Z","title":"Minding language models’ (lack of) theory of mind: A plug-and-play multi-character belief tracker","venue":null,"work_id":"bb7f6a21-a4a1-4310-b9c9-fa4e7031498e","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.748911Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b46a9425483742f9f9da30313adbf2d87b23a33b590b0361e36f76664c9960bc","observation_id":"abc18ea5-439b-42e7-8be0-9fa1e59807ef","resolution":{"observed_at":"2026-08-12T15:33:32.089639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.864230Z","title":"Muma-tom: Multi-modal multi-agent theory of mind, 2024","venue":null,"work_id":"5be8c5f8-98ee-495c-ae41-1fa020a04dd6","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.808735Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:845d9ec9dfef53187b421b2e3c065b7b9ab8f6b2866104e8d6f92bf310a93b40","observation_id":"6e1dcf27-8b75-47fc-bdcc-2e6d327657cd","resolution":{"observed_at":"2026-08-12T15:33:31.969358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.850754Z","title":"PUB: A pragmatics understanding benchmark for assessing LLMs’ pragmatics capabilities","venue":null,"work_id":"13301b25-dd28-442e-b277-b43248eb8c0d","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.880056Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:707911154065b20b20189017c32e2de1a68d723873dc9d325896cb967be2c895","observation_id":"c7160918-d9e7-42f7-b088-b65fb9f8f0fd","resolution":{"observed_at":"2026-08-12T15:33:31.855245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.839302Z","title":"DeepMet: A reading com- prehension paradigm for token-level metaphor detection","venue":null,"work_id":"68c5f154-92ac-4620-829b-1a6610cfa673","year":2020},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.919278Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b9f52e26a54cff8e0456ff3ae1595bb5456340b94a723402f573a227932ad03c","observation_id":"19f5b359-332b-4f1e-9dd1-4579c83a7168","resolution":{"observed_at":"2026-08-12T15:33:31.843077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.822464Z","title":"DI- RECT: Direct and indirect responses in conversational text corpus","venue":null,"work_id":"371baff5-a02e-4d84-b622-005d4ee22cec","year":2021},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.953782Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:7978635e3259f53c79151948bea4c8eb33ff7cced6f07931eb3ff30eb89c7dac","observation_id":"ac6e0274-2e0f-4296-ab3a-dfd7bc45b0bd","resolution":{"observed_at":"2026-08-12T15:33:31.831178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.732182Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"a11a3f2c-bd6b-496a-b31f-42ba1d9c4df7","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.969003Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:8a86c3ad06fb6dbc24590c0896f487ed5708c9ba2d936f15dd223285ec7350cb","observation_id":"3d4ab97b-f7b2-48df-bfd2-effaea1efd81","resolution":{"observed_at":"2026-08-12T15:33:31.795572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.563438Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":"c9bf6173-3db3-4bd4-bea1-a58f71ce8f44","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.977505Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:aab0316f651aff91741101dec74f80c70f7b957272646439c2f9ba6383cd3fff","observation_id":"6a1a174a-3c50-46cf-9956-e946f535b7b3","resolution":{"observed_at":"2026-08-12T15:33:31.649099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.549609Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"a33452ae-6b38-4e75-91a1-43fdf7eb3e0a","year":2025},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.992645Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:fec14cfe463ee27c60480ae22cad7621b90355dbf1a689ee2cde300f8c0e3a89","observation_id":"64215739-8da2-4f15-85f0-f14fa0a9f0a4","resolution":{"observed_at":"2026-08-12T15:33:31.553501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.534175Z","title":"Chain-of- thought prompting elicits reasoning in large language models","venue":null,"work_id":"dc6bd759-7791-4b85-af79-21407eafc8de","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.996424Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:e80ced4bd67f7451e771ea9e6decdc7d3da5a31c3431e858f1117b6270a7a6c6","observation_id":"7039ac4c-e6ae-41e4-ba7f-f40275c4632e","resolution":{"observed_at":"2026-08-12T15:33:31.541019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.463350Z","title":"Social-iq 2.0 challenge: Benchmarking multimodal so- cial understanding","venue":null,"work_id":"9d4b4b20-f696-406e-8faa-c7825db9dd96","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.000418Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:765b7bb13fa19c6e1d70240e8e6bc78774e844e6f40d45e6e385596b1bb6e828","observation_id":"2ca64840-700a-4362-9b3c-50a5d6f7dd53","resolution":{"observed_at":"2026-08-12T15:33:31.496197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.389199Z","title":"From recognition to cognition: Visual commonsense reason- ing","venue":null,"work_id":"14112d72-19c9-4fbe-9027-5abbb95b52ea","year":2019},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.051774Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:c04dce40aa5b979940230ad99399071446d0a00e6be0a731cd140ddd59e32d79","observation_id":"a38ae968-6e21-4293-a9b3-c11a7db38f49","resolution":{"observed_at":"2026-08-12T15:33:31.422414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.246850Z","title":"Socratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":"98914e29-814f-421f-9a3f-46888fb27d97","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.117616Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:7a375c430e3a2d9e1677040351d16821c6ac787a760b426461fd887bbf50374c","observation_id":"57b16e8c-2461-49c2-abd4-73f33b42913e","resolution":{"observed_at":"2026-08-12T15:33:31.315542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.138385Z","title":"Wein- berger, and Yoav Artzi","venue":null,"work_id":"9bc4773e-954d-46b8-9562-7afdbb731326","year":2020},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.201328Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:c307be179bb3d38b0e7e87ac242b261d03f87974ec12014281c8afbb48488909","observation_id":"f0c3630d-05ff-4c7a-a3d6-12295b58a447","resolution":{"observed_at":"2026-08-12T15:33:31.198055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.117273Z","title":"Bad” column while prioritizing those in the “Good","venue":null,"work_id":"c9fb1f0d-b641-46fe-bb71-a18aa57fe968","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.242988Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:987d7b76b06ba738d8157dd475f82aa3393cf0a0e002fc451711eeef374c1ad1","observation_id":"e0a86bdf-ff9a-4530-9bb7-513d136e4fa8","resolution":{"observed_at":"2026-08-12T15:33:31.128735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.027106Z","title":"Hey person2","venue":null,"work_id":"d77f44fa-e6f5-4754-9ad6-59300dd4dd45","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.299633Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:0b4e181feca466badcc5afaadb5bbf1b7e987251e05aabfa032a7db59cd904f3","observation_id":"e95b160c-5c97-4ad7-b7a9-b24ed52add92","resolution":{"observed_at":"2026-08-12T15:33:31.076114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1055.54406","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.504053Z","title":"open the window","venue":null,"work_id":"c442a362-7fd7-462a-be66-c8caf6e36be7","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.363072Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:98b42751fba17457481638034e843a5a16e2f4552dcb23b3841bb106ca81ea27","observation_id":"b5850ed6-dbe6-48d5-83a4-cb1257283f3f","resolution":{"observed_at":"2026-08-12T15:33:30.538335Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:29.401122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.401122Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:2469ff092f39e698a7a8030175b4850dcd98d5298d60bd1e5b5144e1ebffee2f","observation_id":"32120be0-7b3a-4d22-861a-b96d80eb6db9","resolution":{"observed_at":"2026-08-12T15:33:29.401122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:28:08.122465Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2411.14137."}