{"as_of":"2026-08-13T06:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1bca0742584f3f5ad064839c26215645ef0b11ceca5ff0a7ba224b2c7a221736","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:57:29.201224Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:24:57.169737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:36:05.014470Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"cited_work":{"arxiv_id":"2411.17794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17794","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nemo: Can multimodal llms identify attribute-modified objects?","venue":null,"work_id":"c28ad77b-8d18-4d23-952a-bb5085136634","year":2024},"citing_paper":{"arxiv_id":"2604.13313","last_updated":"2026-04-14T21:28:46Z","snapshot_observed_at":"2026-08-06T18:52:27.264982Z","submitted_at":"2026-04-14T21:28:46Z","title":"Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T15:24:57.169737Z"},"links":{"cited_paper":"/paper/2411.17794","citing_paper":"/paper/2604.13313"},"observation_digest":"sha256:53ee1e0fb1ee48660f4a619233bbf182c725e608cc90fff3c7f157ef93045300","observation_id":"12c5c272-28de-4f42-aea7-07925d6fb9d8","resolution":{"observed_at":"2026-05-11T10:36:05.021149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17794/citation-record","integrity":"/paper/2411.17794/integrity","json":"/paper/2411.17794/citation-record.json","paper":"/paper/2411.17794"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:30.007395Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":"c0996794-882a-4fc3-94a4-73a5dcebb6e7","year":2022},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.007620Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2281a4b697117add2ef8574c4ab790e5dfbc93accf80fe5c9ab3940f3c12d88a","observation_id":"9c1ff511-65d0-40df-b468-58e372740f50","resolution":{"observed_at":"2026-08-12T11:57:30.011651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T11:57:29.012130Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.012130Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:7c4ed4aa83e77642eaa451aab1b8636df8b039bc638a1419cd5057d498a7c84f","observation_id":"ebb4e11c-4f2b-4fb0-8171-5f3d23a204d6","resolution":{"observed_at":"2026-08-12T11:57:29.012130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.995116Z","title":"Breaking common sense: WHOOPS! A vision- and-language benchmark of synthetic and compositional im- ages","venue":null,"work_id":"83d7d952-1cac-4159-bb8a-65ba0451add3","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.016492Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:c51338ae4776c25ac61f896b906825df3b551c21e7cd76df8f3aea0c1b8cb813","observation_id":"4d88c780-105f-482c-bf8a-810709dde470","resolution":{"observed_at":"2026-08-12T11:57:29.999362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19474","last_updated":"2024-11-25T12:53:44Z","snapshot_observed_at":"2026-08-12T23:13:26.513193Z","submitted_at":"2024-07-28T11:56:03Z","title":"Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19474","snapshot_observed_at":"2026-08-12T11:57:29.020551Z","title":"Visual riddles: A common- sense and world knowledge challenge for large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.020551Z"},"links":{"cited_paper":"/paper/2407.19474","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2ffd1eeba396cef234162b47b62a971684efe90f3371e47929e98b989b2b6837","observation_id":"28130577-7c02-4337-8cc3-d06c740ee696","resolution":{"observed_at":"2026-08-12T11:57:29.020551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-12T11:57:29.024930Z","title":"InternLM2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.024930Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:09a136627b4eac16b0db7f1e3254efdaac00651516bbeecbe96b2310fedf33e3","observation_id":"35c01332-1ba4-4faf-9734-98138069ce28","resolution":{"observed_at":"2026-08-12T11:57:29.024930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-12T11:57:29.029279Z","title":"MiniGPT-v2: Large language model as a unified inter- face for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.029279Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:ffc59dcdb4fdedfd6794642b5fc54ee149672bf9f2aeb0e9e758c70ab9ced7f7","observation_id":"1c78c158-3ead-4c2d-bc7a-a01149fe323d","resolution":{"observed_at":"2026-08-12T11:57:29.029279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T11:57:29.033836Z","title":"How far are we to GPT-4V? Closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.033836Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:4895d97728cb91543579a1ee751e7c85ac4532a71db8238205898e09174975ee","observation_id":"1919acb8-38ab-48f9-abdf-90f621f7af2a","resolution":{"observed_at":"2026-08-12T11:57:29.033836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.982873Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"309f40b7-5bc2-4c0d-adb2-9aa5560c48bc","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.038639Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:5b1244b01aad71de97ea9b4e593bbd690f54b35e1632e2264ce64eeca559f04f","observation_id":"00deef47-f46a-4d61-862a-2d659f2a2e3d","resolution":{"observed_at":"2026-08-12T11:57:29.986905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.970648Z","title":"InstructBLIP: Towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"11e8cc84-577a-41d5-89b7-863c19c4f882","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.042409Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:4ac7fd4acf61932dff5c0e62682996eaf7ac5be628e8f333614b17d962ac33b6","observation_id":"ffb52276-4dbf-42a5-a8a7-6188c612ccf3","resolution":{"observed_at":"2026-08-12T11:57:29.974761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.957513Z","title":"ImageNet: A large-scale hierarchical im- age database","venue":null,"work_id":"f4978810-9845-4c00-ba8c-b0a893d0b345","year":2009},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.046295Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:3790f4a73592c3a3e8608d0703e39b9ad6d20e946a26a2bf2f4c37d1632721d6","observation_id":"74bc106e-3051-457d-bd6b-6fdf84bf9da0","resolution":{"observed_at":"2026-08-12T11:57:29.962422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.944736Z","title":"Scaling laws of synthetic images for model training","venue":null,"work_id":"74823d86-8597-4a40-ade7-d1a65a1f4681","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.049953Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:ef4f9ef3dd94e3b2092e02f5dd7cd0548795c136489674754e150f5db82e4a25","observation_id":"acce52c3-5ad4-4f5d-ab4d-d6ec5a633617","resolution":{"observed_at":"2026-08-12T11:57:29.948764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.932482Z","title":"EV A: Exploring the limits of masked visual represen- tation learning at scale","venue":null,"work_id":"ca6466d8-0245-4a10-a275-65cb0e48d431","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.053556Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:53a224739ea98c53023e3dcaa83eafbbaabdaedb0b58e269b28234a6983cdd73","observation_id":"6958ca54-6c05-485d-bb6d-d0752481924a","resolution":{"observed_at":"2026-08-12T11:57:29.936580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T11:57:29.057433Z","title":"MME: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.057433Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:31b46838b3377cb7336d41a7c97b49d149c0442e19e587465d6f8604f268acee","observation_id":"f028fc6e-4b57-478f-87fb-90e4505b9d39","resolution":{"observed_at":"2026-08-12T11:57:29.057433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.920328Z","title":"Gemini., 2023","venue":null,"work_id":"feb853a7-6fd9-4e47-8c74-db6f798c86e1","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.061609Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:d2d268d98d7f52ff0863421d8b4658e569eac7f909e76710516f8ff75a40ffd6","observation_id":"8e81c1a8-f204-4538-aa07-3588ac598431","resolution":{"observed_at":"2026-08-12T11:57:29.924269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.907915Z","title":"Hal- lusionBench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision- language models","venue":null,"work_id":"c7619652-e1ca-4ccd-af92-b665e83d069e","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.065609Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:d2aa718973ee0d048bb1b330d02eeb6591434ca23e260f3842d5891fad2074bc","observation_id":"6413d14b-cc83-41c8-b741-b53012ff8f07","resolution":{"observed_at":"2026-08-12T11:57:29.912168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-13T05:15:43.956937Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-12T11:57:29.069305Z","title":"SEED-Bench-2: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.069305Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:1facdbbbaf0dc6ddadc34669a94a1f0ede4665b43aec951256594c5f21370c9f","observation_id":"3c0226eb-72d7-4783-b93b-32da6202be57","resolution":{"observed_at":"2026-08-12T11:57:29.069305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.894099Z","title":"SEED-Bench: Benchmarking multimodal large language models","venue":null,"work_id":"5cb190a0-75b7-4852-af07-8f949fb430b4","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.073147Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:56fdbe2c6b077603c7cec12849d901bd4a4093145ff05524ae29cafd63b3b2c9","observation_id":"bf354ab2-46c2-4c6d-bda0-fce9785b7fb3","resolution":{"observed_at":"2026-08-12T11:57:29.898939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.881924Z","title":"Naturalbench: Eval- uating vision-language models on natural adversarial sam- ples","venue":null,"work_id":"4b879658-a946-40a9-af50-32f245a43347","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.076856Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:c6c23e80e800309647a7970d994df33fe5e04879bf5081cbccc5fd94d64035c9","observation_id":"9e0f7929-dcc2-4b94-94b7-2719b23accc1","resolution":{"observed_at":"2026-08-12T11:57:29.885960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.869877Z","title":"LLaV A-NeXT: Stronger LLMs supercharge multimodal capabilities in the wild, 2024","venue":null,"work_id":"8817f676-94a0-41c6-bcdc-70861f90bc94","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.080548Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:7f882ce43bf2f03d6588a389ecd941a67ecc05c1e598ed12544ed42aa950a1b5","observation_id":"ff023b8e-d03c-49d6-b83c-0884b3184ae7","resolution":{"observed_at":"2026-08-12T11:57:29.873904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.856476Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"d65b4457-bdcb-4d07-adbf-5fb88fd2ba4f","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.084349Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:e69e68016f64279b4f88788f68c4f04ed87961a2c5e3622fd64a3455a096c3d7","observation_id":"46ab11c0-667f-421e-85ff-310e912d9999","resolution":{"observed_at":"2026-08-12T11:57:29.861617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.843909Z","title":"FoodieQA: A multimodal dataset for fine-grained understanding of chinese food culture","venue":null,"work_id":"64dfc797-6929-4bb3-867a-0f1311a6bdc9","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.088284Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:861bf3302c6b548f9ff8ac48f6bf93420c2de7bd10358e0337df014fa0bdf759","observation_id":"8171e875-5c42-4ad9-b087-14455198dcc0","resolution":{"observed_at":"2026-08-12T11:57:29.848224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.734059Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"7aede258-c7ac-4628-a540-398adb10e3ea","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.092028Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:91fb051c1b9be3009bfd15b41c782d40da0585991bb0d08f87b95c432dd4536a","observation_id":"e336f4b7-b409-40ee-b9c5-38effed72c9f","resolution":{"observed_at":"2026-08-12T11:57:29.834662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.721469Z","title":"Visual instruction tuning","venue":null,"work_id":"36246054-0df1-45be-8f7f-100c0809b900","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.096069Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:f044f598eb3ae1ec3918be76521240633bec42eafec19fd418755f0afd86b25c","observation_id":"aa38c0a9-84f6-4197-82be-97650e95f758","resolution":{"observed_at":"2026-08-12T11:57:29.725556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.707880Z","title":"MMBench: Is your multi-modal model an all-around player? In Proc","venue":null,"work_id":"0f54020b-47e8-4173-8704-1c7690474367","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.099764Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:798765a3ff27429453d7a294ac9236149e1d032abe8d464d4b4f91b363b74625","observation_id":"fcbe0d19-002d-48d1-b745-40cae90a2cd5","resolution":{"observed_at":"2026-08-12T11:57:29.712165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.695383Z","title":"From here to human-level AI","venue":null,"work_id":"267ea76a-b0b4-4194-9e94-791f0d29f73d","year":2007},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.104119Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:694e54e207ced95d38e98272f03b90da8f89745165b089d6db20412434352593","observation_id":"f3b36e6e-ba15-4cde-b70b-14c99e052a24","resolution":{"observed_at":"2026-08-12T11:57:29.699235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20331","last_updated":"2025-06-09T11:51:00Z","snapshot_observed_at":"2026-08-13T00:41:52.316492Z","submitted_at":"2024-03-29T17:59:53Z","title":"Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20331","snapshot_observed_at":"2026-08-12T11:57:29.107976Z","title":"Unsolvable problem detection: Eval- uating trustworthiness of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.107976Z"},"links":{"cited_paper":"/paper/2403.20331","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:ec1d72d2d6e8886a8985cb978e640b62b99973ed97f3a1b0f3dacf7d1a3a5a74","observation_id":"1a8c0e8a-bdf5-41f1-a0cf-5c0bd195d76b","resolution":{"observed_at":"2026-08-12T11:57:29.107976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.683435Z","title":"Position: Levels of AGI for operationalizing progress on the path to AGI","venue":null,"work_id":"70f8b662-85b3-43c6-b737-1455306f0ffe","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.112023Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:4dedf0581677d5715f10e3b3bfbeba2cb44627cc5b7699ee4d8406cc814136d9","observation_id":"c49d540f-1f35-4ffc-9263-f5213194d74c","resolution":{"observed_at":"2026-08-12T11:57:29.687401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.671513Z","title":"GPT-4o, 2024","venue":null,"work_id":"2c74d1c1-5354-444d-a498-b2ac0b870831","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.115794Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:3af5b392bcb8cbeac682c7c7eef73d73152ab48f75257df7b6a2960e23ed93a3","observation_id":"ffeb8b1c-da57-40a3-b4ff-3d21227f552e","resolution":{"observed_at":"2026-08-12T11:57:29.675430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.658900Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"b6a2d7d2-b80d-4a16-8649-054939fd7b80","year":2021},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.119566Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:c6ac6d4c231fb0f9463587c28b7cb3f5b63599a965422e602a08893cdfe651e5","observation_id":"b80c38a8-aee4-464f-a679-dbe8ac3a27d2","resolution":{"observed_at":"2026-08-12T11:57:29.663227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.646630Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"398082c7-63ba-4557-b7d7-621d41c684a2","year":2021},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.123316Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:77b0d10181b07e1aa9d292160fb4ffda49e89f8e8dd6536901ce262c207b2aac","observation_id":"47900640-6151-4743-9d30-7e73eb74b853","resolution":{"observed_at":"2026-08-12T11:57:29.650633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-12T11:57:29.127230Z","title":"EV A-CLIP: Improved training techniques for CLIP at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.127230Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:afe5efdebc0eefde0e5bb76bc542508eec5e284e1d59d6a2e9359bb5fe840d13","observation_id":"2ecd108c-8b53-46b6-bdcb-7417fe87ef9e","resolution":{"observed_at":"2026-08-12T11:57:29.127230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.634115Z","title":"Link- context learning for multimodal LLMs","venue":null,"work_id":"d0068b8f-49c1-4af5-add5-704a49d42e57","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.131172Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:df5c97d9c8dc58c557e2899b437f6b37c92455eb3739e7aabb21fe04021df6fd","observation_id":"ed030b23-9307-49ba-a19a-715009b5ff27","resolution":{"observed_at":"2026-08-12T11:57:29.638505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.622010Z","title":"Label Studio: Data labeling soft- ware, 2020-2022","venue":null,"work_id":"7d01256d-4ec4-45af-9cc0-d26aa6884f9a","year":2020},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.134990Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:07574530ec622b2e08fbb686c9fee89fc229af6b392f7f4b13702016645a4d73","observation_id":"aace756d-93a0-47ea-b5ba-7a43b3f73cb4","resolution":{"observed_at":"2026-08-12T11:57:29.625949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.609032Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal LLMs","venue":null,"work_id":"ee6b54a9-8557-4eac-9f50-465d3f71dbea","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.138719Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2b9225412292776540c4437f25fbcc154d6f2264bcf0a22eb5223b6276f1737f","observation_id":"79b3aa1f-b5ff-434c-9691-f332dc9bf7d9","resolution":{"observed_at":"2026-08-12T11:57:29.613670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.596426Z","title":"Eyes wide shut? Exploring the vi- sual shortcomings of multimodal LLMs","venue":null,"work_id":"5a7d129d-7962-4a53-af74-b3deddf126e9","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.142487Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:e14db9313785f1188ad62a58b7bb0187b8463695782ebc54ce96e3dfe714bcb0","observation_id":"c7dc8d40-bde3-44b3-b14b-90fd04aab1b4","resolution":{"observed_at":"2026-08-12T11:57:29.600539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T11:57:29.146242Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.146242Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:f54cc340950b8de8b027a1893140c8a77fa8781d7e6f154c97ef4f9796577b16","observation_id":"a603c976-d34d-4b55-9bf0-0b714c5c1afc","resolution":{"observed_at":"2026-08-12T11:57:29.146242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.583941Z","title":"Recent advancements in fruit detection and classifica- tion using deep learning techniques","venue":null,"work_id":"8dfb9abe-ca05-4748-a81c-8d53a469cc21","year":2022},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.150418Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:ff25221071f2a895dd70e2b173c734ede8e328f4d9a12e72244bd9f2baa8f339","observation_id":"a914c956-324d-478b-ac7e-0e1a1f32ba7d","resolution":{"observed_at":"2026-08-12T11:57:29.588119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.571672Z","title":"Le, Thang Luong, and Golnaz Ghiasi","venue":null,"work_id":"9e5405fd-14de-4e31-8ee9-8882cefcf089","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.154142Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:be65b5c54e723e3fb9e628a8e3f71f6690c2209b455d08967719456b281cf7fa","observation_id":"b55d1ac3-ea59-4cc8-94fb-06298f4b59f8","resolution":{"observed_at":"2026-08-12T11:57:29.575746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.158345Z","title":"xGen- MM (formerly BLIP-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.158345Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:9dca61964e6a8d19eea594acf221452462e12dcea8ef3df2e50bc4c6a5c7571f","observation_id":"faa5d3f1-5b31-417b-95bf-b4231f2d58ca","resolution":{"observed_at":"2026-08-12T11:57:29.158345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T11:57:29.162061Z","title":"mPLUG-Owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.162061Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:086db5af00d68f9e361db7a9f2da7cf5c4107c551441c10e929e8a6d901d2cbe","observation_id":"1bf36864-c24d-45ee-b855-05555cb4c46b","resolution":{"observed_at":"2026-08-12T11:57:29.162061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-12T11:57:29.166131Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.166131Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:bde5333e48b3ed8840b09031e13e4ca80386733eb1e259d9a58b613b4d03a59a","observation_id":"5a9af856-ff51-4cec-a2a9-398e3f64cbae","resolution":{"observed_at":"2026-08-12T11:57:29.166131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.558435Z","title":"MMMU: A massive multi-discipline multimodal un- derstanding and reasoning benchmark for Expert AGI","venue":null,"work_id":"6820ba95-50bd-4346-8a09-b7745d6773ec","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.170068Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:984e99e9fa1e086dba913d85af1d758e0d5e0d909ee05a154c6dd77c2b37b7f7","observation_id":"74f2d605-937b-4203-a357-141d63b74a09","resolution":{"observed_at":"2026-08-12T11:57:29.562615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-12T11:57:29.173837Z","title":"MMMU-Pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.173837Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:53fcf0f94e3d9a8cadf093790eed3c681a6e4779f354c66b73e8847625f1da44","observation_id":"81cedbb2-41d0-4939-9e2c-3a3ce387579c","resolution":{"observed_at":"2026-08-12T11:57:29.173837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.544746Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"cccc4a60-23fb-4211-a099-86e1da3dd31a","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.177834Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:7907727cfa60d8f6972d870da621dad7c8ef07c8be26875368b9b95d7d95ded0","observation_id":"b8aa4ff3-da1c-4cf7-81b8-027479da32d1","resolution":{"observed_at":"2026-08-12T11:57:29.549109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09346","last_updated":"2024-12-28T07:32:00Z","snapshot_observed_at":"2026-08-13T00:54:20.652838Z","submitted_at":"2024-03-14T12:51:07Z","title":"B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09346","snapshot_observed_at":"2026-08-12T11:57:29.181590Z","title":"A VIBench: To- wards evaluating the robustness of large vision-language model on adversarial visual-instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.181590Z"},"links":{"cited_paper":"/paper/2403.09346","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:60ae99c0454f6f233db9e079aa92f0145ae2540e610e412934fe126a90ad7123","observation_id":"cadb536a-be2d-4ff9-b053-f671129816ee","resolution":{"observed_at":"2026-08-12T11:57:29.181590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-12T11:57:29.185644Z","title":"InternLM-XComposer-2.5: A versatile large vision language model supporting long-contextual input and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.185644Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:fdb060a1a3820463f8a6472df853cf61afdc4c65a17019ea080b6fc4d66118d2","observation_id":"aad8ed8e-a71d-4e96-8c3e-28895f934dcc","resolution":{"observed_at":"2026-08-12T11:57:29.185644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.531789Z","title":"On evaluating ad- versarial robustness of large vision-language models","venue":null,"work_id":"4a3a6654-3b4f-4ae7-b584-58936ea50328","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.189782Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:775eda450076140797a9069502087f3347c327f07a17a553c1bf86dcf46e1018","observation_id":"2e0c93ba-4e6b-4e1c-ba84-fb4350a2a774","resolution":{"observed_at":"2026-08-12T11:57:29.536158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.519100Z","title":"ROME: Evaluating pre-trained vision-language models on reasoning beyond visual common sense","venue":null,"work_id":"b80e42b4-d4ce-44a7-9601-91bf48962e81","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.193661Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:3f16ff4d7e9ae6d9e79b90161e6810d9af9d3d6943f0de73a4c732671abada4c","observation_id":"c3dfd032-6ed0-46f1-8e59-f7b0b56f4b73","resolution":{"observed_at":"2026-08-12T11:57:29.523316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.505637Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"22684681-4842-4f2c-9618-90e05627f08c","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.197392Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:51551fe18dc33e8845ef5039dcde530f64c811b9c179f03689dbb82c1bf3740d","observation_id":"84c5baff-60b7-4802-a6df-9bcfe455bf38","resolution":{"observed_at":"2026-08-12T11:57:29.510486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.491639Z","title":"dall-e-3","venue":null,"work_id":"91f1fad6-e3f7-4022-9da3-0fb0ee33d7fe","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.201224Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:c5de2a4995099e8380a0649d15f62db31e9d714f7df16f444c3f6936cd1b5ca9","observation_id":"7053f530-aa0c-49e2-b1da-d1771aef3df6","resolution":{"observed_at":"2026-08-12T11:57:29.496650Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2411.17794."}