{"as_of":"2026-08-12T20:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81a2ad9fd24bc7b5aaf8bae4091efdf18330e5a49d7bdfff241a84d746f399ab","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:52:34.445566Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10252/citation-record","integrity":"/paper/2411.10252/integrity","json":"/paper/2411.10252/citation-record.json","paper":"/paper/2411.10252"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.673925Z","title":"Vqa: Visual question answering","venue":null,"work_id":"63da6bc4-940e-4158-b7a8-c7a42a774ba3","year":2015},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.350474Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:aaa73441e25d549289eaabec743860dc8717700e256d823697ab570352d4262a","observation_id":"6bab4c03-8d17-4f37-9210-c0c87e688353","resolution":{"observed_at":"2026-08-12T19:52:34.677761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.665465Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"71b112f3-3bba-4983-941e-24b1a51c70a4","year":2020},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.354065Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:491d7e95d4d523362fb8cfabd8580f48e90aa2b38f12493a8c26b7109068f79f","observation_id":"8164ff06-df70-402e-a88e-394ba00bd617","resolution":{"observed_at":"2026-08-12T19:52:34.668781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.656814Z","title":"Spatial memory for context reasoning in object detection","venue":null,"work_id":"61801ae8-4a07-4bdf-9cc4-c70ef22ade3c","year":2017},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.357385Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:746aea498db2954cd525319b32540839bfaa474d9d3b4db863eaecd425f6c53f","observation_id":"497d0734-49e0-43e4-98b1-ea480eb2aa38","resolution":{"observed_at":"2026-08-12T19:52:34.660024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T19:52:34.360271Z","title":"Palm- e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.360271Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:d2e5a15d8917839d03866f6a1ccb5e45b22b7a316915d1c7b653e8b25397d420","observation_id":"4c7d22df-37b1-4823-9f10-fb6af8f61c46","resolution":{"observed_at":"2026-08-12T19:52:34.360271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.648288Z","title":"Relation networks for object detection","venue":null,"work_id":"ea2d2501-8a94-4719-bc06-de33914f6f7f","year":2018},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.364262Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:a7c8a90bee085ba4ce6397e41d614605d74215444e58a30ce5f6ebffd5b9f0e0","observation_id":"57f6ee1e-1a6e-45f4-8e5b-ed80f5d3c9e8","resolution":{"observed_at":"2026-08-12T19:52:34.651356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.640009Z","title":"Dac-detr: Divide the attention layers and conquer","venue":null,"work_id":"07162d44-9c1f-4de0-86d9-7af2f6069e9d","year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.367837Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:9e7c05e6bf331e59dbe209689b670b1074308ee223118275df4a48b00faefbca","observation_id":"7d996949-d5e4-4ee2-96a7-865a816aec46","resolution":{"observed_at":"2026-08-12T19:52:34.643131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.631035Z","title":"Hugging face","venue":null,"work_id":"7260b1fd-73dd-49ed-b3e2-894b5faec990","year":2022},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.371002Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:b57faa13c415801c424bda73e26b3ea9a1306ecff5b7e1d4202378cf55078a87","observation_id":"2a9169a6-ae50-4225-b18f-51e92addc00a","resolution":{"observed_at":"2026-08-12T19:52:34.634427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03647","last_updated":"2024-04-04T17:58:38Z","snapshot_observed_at":"2026-08-12T07:51:11.528572Z","submitted_at":"2024-04-04T17:58:38Z","title":"Capabilities of Large Language Models in Control Engineering: A Benchmark Study on GPT-4, Claude 3 Opus, and Gemini 1.0 Ultra","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03647","snapshot_observed_at":"2026-08-12T19:52:34.374839Z","title":"Capabilities of large language models in control engi- neering: A benchmark study on gpt-4, claude 3 opus, and gemini 1.0 ultra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.374839Z"},"links":{"cited_paper":"/paper/2404.03647","citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:e34b17ae11ccc838e948dd9b850ffa0f08a0bc2fbbcf9402a01cd0d261f3ff28","observation_id":"748f5a05-3d9d-431a-81fc-ac3f7c2dff51","resolution":{"observed_at":"2026-08-12T19:52:34.374839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-12T19:52:34.378225Z","title":"Yolov11: An overview of the key architectural enhancements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.378225Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:8264cded4ccd0d377a11167c93c0c91c25561aea0e366e8eacec2468112ba8d8","observation_id":"16e860df-6a81-4d28-aa0d-6d050ea154ce","resolution":{"observed_at":"2026-08-12T19:52:34.378225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.381052Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.381052Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:c0c37fd1545f7b1035f4c680ed1178a976f4370c35d1aff39074d0f854442d9f","observation_id":"1c198296-dd7d-45cd-88c7-d7975601b408","resolution":{"observed_at":"2026-08-12T19:52:34.381052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.384365Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.384365Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:43c01add618007efa47954b3d37f4b5a4dbc528eaec7ce67463e72105b4ec905","observation_id":"22fb73db-7ecb-4055-82cf-01c456cb688d","resolution":{"observed_at":"2026-08-12T19:52:34.384365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.387936Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.387936Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:5e8c5d2e8c531b9f0c40d3074ebe665da29f37a741ad45f7579ede74ac9bfade","observation_id":"5456ba81-9a04-4517-8dda-7cf406361a37","resolution":{"observed_at":"2026-08-12T19:52:34.387936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T19:52:34.390932Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.390932Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:0fab71a0472139b3e3901eae6589e1797e600bf7fcfee112eebc561e11f08d60","observation_id":"fd188497-08a5-47c4-92bc-71550d0c102d","resolution":{"observed_at":"2026-08-12T19:52:34.390932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.610750Z","title":"Cigar: Cross-modality graph reasoning for domain adaptive object detection","venue":null,"work_id":"d241207a-d900-47a3-bbec-12c88c8138e7","year":2023},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.393995Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:2705b59e50f82741c47a9ae08399e3d48e1fd5a39ffdb5b0017cb2edc1f4ee23","observation_id":"eba186b5-0727-42b6-9274-7cccfc43bb54","resolution":{"observed_at":"2026-08-12T19:52:34.613730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.602218Z","title":"Rt-gcn: Gaussian-based spatiotemporal graph convolutional network for robust traffic prediction.In- formation Fusion, 102:102078, 2024","venue":null,"work_id":"7221463b-140c-4439-988f-7df56eefb2f7","year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.396516Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:a56195dd6313a8bca16d7252492576822980276696acd2d4701feb8cb965205b","observation_id":"bc87118b-775a-4597-aa73-379630865c19","resolution":{"observed_at":"2026-08-12T19:52:34.605679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.399174Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.399174Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:9acc78c63cc7afd7b9287fe0e3156c91d77ccbb2d4881696c8084cca28f84050","observation_id":"0e8b8201-ca0b-4297-a91e-492235df3795","resolution":{"observed_at":"2026-08-12T19:52:34.399174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.402350Z","title":"Improving multimodal datasets with image captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.402350Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:f65b6d94e1a867d26cdc503964d9dffd53ea6bc17e33c122199c3b603dfe76ff","observation_id":"df02a91d-858c-4a10-898f-251054fe041b","resolution":{"observed_at":"2026-08-12T19:52:34.402350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.586772Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"9cf657bf-8e1c-420d-a81d-134ba803b481","year":2016},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.405498Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:c9bacec8109d2ef7b61a90631df773a5aa2a7d5b4ca80f028045d1b40b1ecaf3","observation_id":"1c40f5f1-9591-4320-aa40-0ad5103418ea","resolution":{"observed_at":"2026-08-12T19:52:34.589887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.408174Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.408174Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:0fe70924c213724403a87a849e96ad388f69bf40fc64d54119fbe90edb79787c","observation_id":"9a08821b-b50d-4e3e-9799-65fc3ddab5ab","resolution":{"observed_at":"2026-08-12T19:52:34.408174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.411067Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.411067Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:ff784325559e03412f47b65cfa7104fe960bdfa324123555e5be54e13693c3e8","observation_id":"c65c301f-da18-4661-95fa-6e4a9b7e33b4","resolution":{"observed_at":"2026-08-12T19:52:34.411067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T19:52:34.413960Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.413960Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:3f570d6509ba28064dafd1e8a3606c3bd4b096b74b47988ce8727106ae4e9f5c","observation_id":"8d59b5e0-b21d-4934-aa4d-f180653602f8","resolution":{"observed_at":"2026-08-12T19:52:34.413960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.570089Z","title":"Sw-yolox: A yolox-based real-time pedestrian detector with shift window- mixed attention mechanism","venue":null,"work_id":"15c1536f-020c-48a7-a7a6-6d48be66b1f8","year":null},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.416975Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:3c421df53b2c6897f0a09b63095062007e818f9636fc525ef2139e91874251e7","observation_id":"beb84e66-a76a-482a-ab85-60f7be330d96","resolution":{"observed_at":"2026-08-12T19:52:34.573232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.561880Z","title":"Robust motor- cycle helmet detection in real-world scenarios: Using co- detr and minority class enhancement","venue":null,"work_id":"e4b420c7-4456-47d2-af60-6ce1582fc388","year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.419779Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:8d9dce24cf5d91a234952be5de21e97b9d793fd591295de72f20cf6ea45426fd","observation_id":"f56eda0a-6fef-4042-ae26-7cbf19d71c6b","resolution":{"observed_at":"2026-08-12T19:52:34.565167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.422536Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.422536Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:0a163e6c701c7745700b0cafac8d751cb4809887bb192dab0b19695dac3dac5c","observation_id":"c256903f-50eb-447b-8689-ebdac6f56ea5","resolution":{"observed_at":"2026-08-12T19:52:34.422536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.550175Z","title":"Spatial-aware graph relation network for large-scale object detection","venue":null,"work_id":"bad664f8-27f8-4a4c-bc93-2c37db2e913d","year":2019},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.425201Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:0db6a5e71203db8b7ebc044e63208985d1b6f6e347d3dc7da7bae1530c7fbaec","observation_id":"1f29ecd7-33d0-4a94-81a3-511b922490d9","resolution":{"observed_at":"2026-08-12T19:52:34.553104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.542355Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object de- tection","venue":null,"work_id":"70385f2f-f5dc-468f-855a-a6babfb5a721","year":null},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.427800Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:5498a2b9ce4e0060ccb9f3eec35039319f866d3baf3898593db7814e90133ec0","observation_id":"ba35c89b-9d60-4587-ac8f-b00bf13a94d0","resolution":{"observed_at":"2026-08-12T19:52:34.545221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-12T19:52:34.430716Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.430716Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:912d1d4acf23829c5edfbda7e39861d05846a831af1dd43633168758e40fa8bb","observation_id":"862dfc8f-5428-4ee9-9e01-39481688e8ba","resolution":{"observed_at":"2026-08-12T19:52:34.430716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.533866Z","title":"Ms-detr: Efficient detr training with mixed supervision","venue":null,"work_id":"a221538d-bee0-4c0c-a40e-7295d1472844","year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.433880Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:e5bc73269b39a346f8268044b6d8a7bf21dfc6bf29de97579fbc0d1006b1623b","observation_id":"13e55193-fec1-457e-ab7d-3578acd0cec5","resolution":{"observed_at":"2026-08-12T19:52:34.537183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.525268Z","title":"Rgrn: Relation-aware graph reasoning network for object de- tection","venue":null,"work_id":"6b638d66-f4dc-4f52-b49b-a55522a9651d","year":2023},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.436818Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:eaa2678c9962c62e932b75595d57eeffe18f090aadab50dfd09ca2384cb1ca83","observation_id":"a7856eac-afc3-44f8-9bc2-2cb943cffae9","resolution":{"observed_at":"2026-08-12T19:52:34.529019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.516584Z","title":"Semantic relation reasoning for shot- stable few-shot object detection","venue":null,"work_id":"be31c296-8a8a-4afb-8c5a-e85bab5cca6b","year":2021},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.439458Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:663df7e8d88ffb7c5e0762779d0781f6d221809777a646a4c3419d9dd41d159b","observation_id":"4fdae871-b264-4c8c-b8bb-3cd709c50eb5","resolution":{"observed_at":"2026-08-12T19:52:34.519833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T19:52:34.442780Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.442780Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:fafe22709093cccf6bd1b9ad92cc4afc58f0f8730daa3db81871b38121f8631c","observation_id":"11a22183-2bb6-4e6e-a4bb-d76a42d65ae9","resolution":{"observed_at":"2026-08-12T19:52:34.442780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:52:34.505595Z","title":"An efficient two-state gru based on feature attention mechanism for sen- timent analysis","venue":null,"work_id":"7ecfefba-9f45-4065-aec8-d10650c5d4ae","year":2024},"citing_paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:52:34.445566Z"},"links":{"citing_paper":"/paper/2411.10252"},"observation_digest":"sha256:ffd12d0d103d61c336bcdd2752dab0937b0855c07871813757412b6186c668ea","observation_id":"6f9c0d52-e485-4146-8a64-2404eadc8adc","resolution":{"observed_at":"2026-08-12T19:52:34.510345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10252","last_updated":"2024-11-15T15:02:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T19:46:05.436671Z","submitted_at":"2024-11-15T15:02:06Z","title":"Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2411.10252."}