{"as_of":"2026-08-08T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e95d1ef6def3658d3b41412953e2e7826c03fd70af5373470d4e81f94315d21","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:19:40.237501Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19599/citation-record","integrity":"/paper/2507.19599/integrity","json":"/paper/2507.19599/citation-record.json","paper":"/paper/2507.19599"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T14:19:30.864771Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:30.864771Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:46911b1080517fa44d40af54237f6eb145aab89f56dd1481c0d220f90dfbea2d","observation_id":"f4a2b7bb-2e0c-4a06-b9fb-9f8b22e30d21","resolution":{"observed_at":"2026-08-06T14:19:30.864771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:52.227730Z","title":"Burst: A benchmark for unifying ob- ject recognition, segmentation and tracking in video","venue":null,"work_id":"53fa5962-0e15-4868-aa5f-df4c36f7d9ee","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:30.941003Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:4a6183be4430909a86a435d75047a6e2fa9c64b028df00448fbe2698062e7e9f","observation_id":"15a59f5c-3d8f-4f09-ab56-e0507cb122af","resolution":{"observed_at":"2026-08-06T14:19:52.299469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T14:19:31.060322Z","title":"Qwen2.5- vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.060322Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:af7e0a876d3f0edf29097bec9b65e174ca301376c416c3b4cb435aea19d01c8f","observation_id":"72cd616b-060b-4990-93c0-ea6b3f62f79b","resolution":{"observed_at":"2026-08-06T14:19:31.060322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:52.103641Z","title":"One token to seg them all: Lan- guage instructed reasoning segmentation in videos","venue":null,"work_id":"3ed10b48-2c3e-4b02-b2b3-4c61b8350c13","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.203054Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:d5e6111cea7fa7d7c428ba27ade2ff5ebfbb8890b5b8ec0b5de9e2c02f97de54","observation_id":"64102306-6b7f-4f91-80c3-f32aa1652cfa","resolution":{"observed_at":"2026-08-06T14:19:52.160107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.873361Z","title":"Xmem++: Production-level video segmentation from few annotated frames","venue":null,"work_id":"c438af22-1762-4b32-a523-f9a9685b66dc","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.309544Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:feaf014878b9d3222c211310ffab71870c5ae617005eb90862c7af03ad727976","observation_id":"de2d2fdc-fc69-4e84-a048-286ac09946bf","resolution":{"observed_at":"2026-08-06T14:19:52.024268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.678062Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"ef3ac369-2f61-48ca-a9da-790faf2165b8","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.414465Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f2a445060d2de4bfe20c48eb5fd60d9ad8a3bdf32d286ebf2ac82142521c3875","observation_id":"3897ae52-368e-4cf8-a23e-9833ac40268c","resolution":{"observed_at":"2026-08-06T14:19:51.766255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.425564Z","title":"Vip-llava: Making large multi- modal models understand arbitrary visual prompts","venue":null,"work_id":"465a060d-652e-4bd3-88f3-61697bd7bd95","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.529633Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:8d7db93a0ec96b86f3a2abd9e9a17591c388fb3ab4d30633631cefae84de5745","observation_id":"6fca08f5-55d2-42a4-8ad2-c38d9365bb64","resolution":{"observed_at":"2026-08-06T14:19:51.512367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T14:19:31.659606Z","title":"Shikra: Unleash- ing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.659606Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3175ed3e8e9fc6c4f86ab4cc686fe318b518e2e804349d862f811f02613db97d","observation_id":"5d06ad8b-31d9-4502-86fc-bb077eb6f79d","resolution":{"observed_at":"2026-08-06T14:19:31.659606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14469","last_updated":"2024-08-26T17:58:47Z","snapshot_observed_at":"2026-08-03T05:07:34.097529Z","submitted_at":"2024-08-26T17:58:47Z","title":"Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14469","snapshot_observed_at":"2026-08-06T14:19:31.776850Z","title":"Grounded multi-hop videoqa in long-form egocentric videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.776850Z"},"links":{"cited_paper":"/paper/2408.14469","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a1e3ad87ae7ca6818642de93176c3aa02f37561090e239aa5faabc7b62864400","observation_id":"1ee91e18-9a87-407e-9fd5-9213426db69f","resolution":{"observed_at":"2026-08-06T14:19:31.776850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.199838Z","title":"Detect what you can: Detecting and representing objects using holistic models and body parts","venue":null,"work_id":"2a96c1be-d64a-4fe0-a54a-bf4ab20be3c0","year":1971},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.883436Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:392014bba52e406187e0e34af3ad000a0ba08bfa5cf7cf59c8ea2a95df35e227","observation_id":"c8d0e2f8-5dd9-4fac-8c69-b65e8e9c55ea","resolution":{"observed_at":"2026-08-06T14:19:51.309218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T14:19:31.985474Z","title":"How far are we to gpt-4v? closing the gap to commercial multi- modal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.985474Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:803c5dbf164941dfeb07cf84e562bfbc6a9cf2308a3edb66b452a8025ec3b064","observation_id":"87cfd5da-20c0-4dd2-be86-c82accb6bea4","resolution":{"observed_at":"2026-08-06T14:19:31.985474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.977071Z","title":"Xmem: Long-term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"d1786eba-f622-4d09-8dd7-45315f7c61eb","year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.101781Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a4a4c7113789a0cc74b737a32536411e7192b8bb586feacc02aa0c1775d2adfa","observation_id":"08867776-fa48-4a4a-afc0-7032580eddf9","resolution":{"observed_at":"2026-08-06T14:19:51.085303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T14:19:32.183705Z","title":"Videol- lama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.183705Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:9a2e860a2dc52c1caf88b2ddb55998360504b79462523290a50c4ec9cb35f03f","observation_id":"467cceab-2790-4e27-8aab-b4c40e40fda3","resolution":{"observed_at":"2026-08-06T14:19:32.183705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.742457Z","title":"Grounded question- answering in long egocentric videos","venue":null,"work_id":"ee2e7a8a-8a5d-4013-bf1d-24cc550a8098","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.316400Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:481c347d29f575bee8fed2dfc2a87e3a6ea60786ff7dab2609ec6b5e14871d4f","observation_id":"6e4f8a82-6789-47d6-ab6f-b8fe37747739","resolution":{"observed_at":"2026-08-06T14:19:50.848944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.447312Z","title":"Mevis: A large-scale bench- mark for video segmentation with motion expressions","venue":null,"work_id":"a0164c6f-8ca7-4ab5-8564-869f1d29f949","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.471391Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:483383c89238bdfd51ee8e4a9535ce124817caddd6ee87de0536b029b5d501eb","observation_id":"b9e99d39-f6dc-4276-9c58-823895421b22","resolution":{"observed_at":"2026-08-06T14:19:50.598223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.107194Z","title":"Mose: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"f351435b-5696-41c2-89ea-b01db917e6b8","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.592931Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:8f681066ce209fbd0e746993b9d82dea1627b063c7ed3c849ede8313d4f1dbb7","observation_id":"d3ab6386-277c-40ad-a059-8b69694a63cc","resolution":{"observed_at":"2026-08-06T14:19:50.279506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19326","last_updated":"2024-05-01T01:30:58Z","snapshot_observed_at":"2026-07-06T18:07:30.890899Z","submitted_at":"2024-04-30T07:50:29Z","title":"LVOS: A Benchmark for Large-scale Long-term Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19326","snapshot_observed_at":"2026-08-06T14:19:32.702316Z","title":"Lvos: A benchmark for large-scale long-term video object seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.702316Z"},"links":{"cited_paper":"/paper/2404.19326","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:4f0c91d16d76c54615d4eff44180697e132a3760386d9f5cd64e47b156a28488","observation_id":"a69ad915-4348-4f40-b026-8ab69739055a","resolution":{"observed_at":"2026-08-06T14:19:32.702316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T14:19:32.811828Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.811828Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3ed3653a686f94ecc8b3f8aa8018c9d061102cc39c36af752f6c2fd9435111eb","observation_id":"615ca1a8-b839-481e-86be-2a949d326ed0","resolution":{"observed_at":"2026-08-06T14:19:32.811828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T14:19:32.918892Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.918892Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1c53d5a6379bf308580e5b63bfc5cc5bc489724930a398d02d34c623fe2ffb53","observation_id":"2a6d0135-259a-4498-af7e-5c2be488fbd3","resolution":{"observed_at":"2026-08-06T14:19:32.918892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.837594Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos","venue":null,"work_id":"9a6b9c98-7bd6-479e-8d9d-fc9bf5b5aba7","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.036045Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:529dda589e3cc988742936e75de7da842204e894b4c85a5277a2e8d3cd749ad5","observation_id":"a4d82382-ce65-4f2f-90f6-875055bd318e","resolution":{"observed_at":"2026-08-06T14:19:49.949105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.607871Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"cf20afef-f68c-437d-aee2-6eb09522334f","year":2014},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.140267Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:b92a199705ec0fe0aeb03997b47826609387805b0c735d4fb717768d77a539f5","observation_id":"8e024cfc-dbb8-4abf-99fb-9249ed304db2","resolution":{"observed_at":"2026-08-06T14:19:49.720019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.361370Z","title":"Video object segmentation with language referring ex- pressions","venue":null,"work_id":"29a4c456-86a4-4162-91f3-a1691cd65168","year":2018},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.238590Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:90f1d143cc8aa4656fe12ba4bd05a63559ea778e1b6f6fcc43c097bafe15b43b","observation_id":"29c9ab82-2837-4706-add4-46a147faccd3","resolution":{"observed_at":"2026-08-06T14:19:49.479956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.087270Z","title":"Segment anything","venue":null,"work_id":"a61186e7-19cd-45ec-bcb7-2724a851d6e7","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.380141Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:20073bb5d4644d1985a27015598004324bdbd7dc12096a5f50ad39501890db0c","observation_id":"a306dbb0-bdd4-4aa2-8e53-6b96dab7dc20","resolution":{"observed_at":"2026-08-06T14:19:49.210901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:48.812855Z","title":"Grounding language models to images for multi- modal inputs and outputs","venue":null,"work_id":"95929796-da84-4548-beb1-9ed062fd91ab","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.502374Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:93b7e1a92da9ff0f0249168a616f0b8378ad5a4e1019bb3f7100bb8c32358db3","observation_id":"79e37907-115d-4a89-8f14-eeb865c5259e","resolution":{"observed_at":"2026-08-06T14:19:48.929539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:48.502608Z","title":"Generating images with multimodal language models","venue":null,"work_id":"f653dd61-04a3-4b6d-8c38-2f2ecb3a1ecd","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.605622Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:732768a3229aa92720007c50efd2d081986c9743040ee8e4f918c92daf930e9c","observation_id":"58447ff6-88b7-4e0d-ab6b-135f1d9fc163","resolution":{"observed_at":"2026-08-06T14:19:48.636508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:48.207497Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"a28344fc-663f-4dfa-a0d6-6704aa657abb","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.708532Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:b025c80a75cc357c51dea26c6387e91afad2a02f3d6e9afbf0707f87b00e8531","observation_id":"d3f1ad95-2d6d-41cb-b41c-26b35e07aed9","resolution":{"observed_at":"2026-08-06T14:19:48.380741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-06T14:19:33.841194Z","title":"Mimic-it: Multi-modal in-context instruction tun- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.841194Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1517a978bb384bb4a08e0db6ace9c1ae7c1abd9a2f5eac89eb6a52626182cd8d","observation_id":"f50cf220-2210-43f9-852c-2d9ad08ed121","resolution":{"observed_at":"2026-08-06T14:19:33.841194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T14:19:34.009655Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.009655Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:60e71d019f836694955b2a4d0e05f56e83c0f5bfe8ab4ea4a3e2dc2d3e87e04a","observation_id":"95ea52ed-4eec-4bce-990b-893c9990c20e","resolution":{"observed_at":"2026-08-06T14:19:34.009655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T14:19:34.124422Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.124422Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1b690aa675409f5995713ab0ee5d30a8ccb7aef3e6390a6bd42469e2e9f0b5e3","observation_id":"f7cad20f-21af-4df1-92e8-4210147ffecf","resolution":{"observed_at":"2026-08-06T14:19:34.124422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.965442Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"647eb501-6f38-4e7c-957d-d0b1f544df51","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.242376Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:32d4ae5a5c2e40e0749773b0972e2e0eec9bf1e77c5f3a37a15d50822a90aab1","observation_id":"172277c2-04cd-4578-9645-535d88e70850","resolution":{"observed_at":"2026-08-06T14:19:48.097986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01203","last_updated":"2023-08-18T18:48:33Z","snapshot_observed_at":"2026-07-06T13:27:22.300465Z","submitted_at":"2022-07-04T05:08:09Z","title":"Towards Robust Referring Video Object Segmentation with Cyclic Relational Consensus","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01203","snapshot_observed_at":"2026-08-06T14:19:34.362625Z","title":"Towards robust referring video object segmentation with cyclic relational consensus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.362625Z"},"links":{"cited_paper":"/paper/2207.01203","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:930835d58839794515468dc0ab28f405d185a527698ef36a4f61344b70283675","observation_id":"3a772343-879c-4ae3-8d14-0f5d729134dc","resolution":{"observed_at":"2026-08-06T14:19:34.362625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.734557Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":"d318550b-d089-4220-ad6a-b9488da5fee0","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.543370Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f52efdb27ef226ed41af36fefe3a1ada326b48d6a93c66de7b6b9c4e043833e9","observation_id":"0b453265-6047-4a43-867c-f4127e8ee3d2","resolution":{"observed_at":"2026-08-06T14:19:47.846987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T14:19:34.701074Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.701074Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3f959a6a02e7076fe410c3dcc823f17fc88524a104b24181337267668fdfa2de","observation_id":"b81e087f-251f-40a7-ae09-ceb99b331e7a","resolution":{"observed_at":"2026-08-06T14:19:34.701074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.425295Z","title":"Rouge: A package for automatic eval- uation of summaries","venue":null,"work_id":"42d2839a-8519-4e34-aa4a-258c9c5b1295","year":2004},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.792454Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:56a5414684008e7a51eb138fb52422c4c1833faea688bc3a907ecc68f316ef78","observation_id":"1237dd00-ff9e-45c2-adab-a977ca078d9e","resolution":{"observed_at":"2026-08-06T14:19:47.568836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.158110Z","title":"Glus: Global-local reasoning unified into a single large language model for video segmentation","venue":null,"work_id":"bde690b7-9cb6-4aba-9d05-5980130ebb89","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.885264Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:046c9b08c70008af40265b84eb7a5831da3bc0005f6f6e6801abcb336abc7569","observation_id":"a155d143-04a0-4678-ac25-5bd7cbdcefed","resolution":{"observed_at":"2026-08-06T14:19:47.292410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.908053Z","title":"Visual instruction tuning","venue":null,"work_id":"8f9f4745-a979-4167-baa0-173bbf1046b1","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.986936Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ee064ba958f0426a19b6e7cb565d29688c5ce5e7c9f729ef258a1bca6156995b","observation_id":"a14696b6-30a5-4cce-8ba6-08e350b0cc02","resolution":{"observed_at":"2026-08-06T14:19:47.019287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.620551Z","title":"Lamra: Large multimodal model as your ad- vanced retrieval assistant","venue":null,"work_id":"77093ec2-136d-4863-8ffe-63c7c90fc72b","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.099805Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ee946e69738a5aff6bd13fb31bb397f1dc2eb2fbebd0bc84f7d6f3ea43e21565","observation_id":"47c75236-174c-43bb-82be-0cc419d7d744","resolution":{"observed_at":"2026-08-06T14:19:46.770684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T14:19:35.242260Z","title":"Decou- pled weight decay eegularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.242260Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a57d185844a9f6eb7e67e173844ebd91000d0d51b8ae8928f2b0e3dbab8dd526","observation_id":"2dc44f75-013a-403d-be4b-9560b923ed50","resolution":{"observed_at":"2026-08-06T14:19:35.242260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T14:19:35.344758Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.344758Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:c008d655fad5b9b50c1eb4d0de8f2758a2c8d37166587c9946b6c5abc96fe4ea","observation_id":"aa765c0b-ad33-427e-93f2-d3503289bb97","resolution":{"observed_at":"2026-08-06T14:19:35.344758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.403058Z","title":"Generation and comprehension of unambiguous ob- ject descriptions","venue":null,"work_id":"9dac99c5-4f55-445b-825b-0e855828a8d1","year":2016},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.462523Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:d2fdd5ddc33e910f522f17cfc7badf7e85b9d2a084c4a6b096f1e56a85750fa6","observation_id":"6cbe70e5-59c8-4e31-98c6-eee78a3e78ec","resolution":{"observed_at":"2026-08-06T14:19:46.495180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.198740Z","title":"Large-scale video panoptic segmentation in the wild: A benchmark","venue":null,"work_id":"abe856e6-c25b-44f8-8e28-1f879b7d0a25","year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.567110Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:5d0dd601336dfcad676de8a94d51177d03cac8baed9b74ab333ba6c11cdd6c84","observation_id":"1ea753bb-c75a-4a3c-af41-dcc1cd2756be","resolution":{"observed_at":"2026-08-06T14:19:46.303905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.929154Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":"c39c7a33-531f-4d87-afc6-ce35e99736c7","year":2016},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.730518Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:63138f49c09d0dbdf5710b5a0d5e88495b77ff628ea89c7de05b95bcc351dd6a","observation_id":"18aacfb3-e0e4-4215-bf55-5ba9bff3d63f","resolution":{"observed_at":"2026-08-06T14:19:46.043914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.722847Z","title":"Bleu: A method for automatic eval- uation of machine translation","venue":null,"work_id":"f0dd0919-9390-44da-96be-52be5167f798","year":2002},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.851977Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:330fe398928c3ffc17e6abee98e765864d709f7d8f10982865650f2c8c0e7f2d","observation_id":"0ed6dda5-284f-482d-af20-571d707c01f7","resolution":{"observed_at":"2026-08-06T14:19:45.806001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.458530Z","title":"Perception test: A diagnostic bench- mark for multimodal video models","venue":null,"work_id":"aa6de19f-1a9e-44bc-96c1-b5d545bc422f","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.974409Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ce471d67fd3df6fd61329c79685ac3f2d4fdda092915ed930dbc51d93fb1a0f3","observation_id":"4fc8125a-1305-44cd-931f-26d4ddd572c4","resolution":{"observed_at":"2026-08-06T14:19:45.588351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T14:19:36.065603Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.065603Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ef36f01a7c67f3a53b9ba5aad3f89bf9a719ee4c380633fe745ef51a1398c1a0","observation_id":"07e3f2f3-ce0a-4fc7-b345-467de8bfbfab","resolution":{"observed_at":"2026-08-06T14:19:36.065603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.220066Z","title":"Occluded video in- stance segmentation: A benchmark","venue":null,"work_id":"2106fb22-8b65-4b08-8353-bac32b51eb5b","year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.172270Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:9fa1702f2eb668a0719c91ec4638aa0c819d02ebb3afa38becd4fc1b460f6164","observation_id":"fa54ea9a-a496-4f7e-aace-b97d167440a3","resolution":{"observed_at":"2026-08-06T14:19:45.342672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.966203Z","title":"Artemis: Towards referential un- derstanding in complex videos","venue":null,"work_id":"8c02356e-d5cf-464d-a0e5-251e1433c455","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.327772Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:c6286ab6ef752c10b02d652613bd8814cce1ee9b789f1a7c1cb825e1e6348e1a","observation_id":"c5968d3d-6c7a-4dee-8860-bda3c817aa7e","resolution":{"observed_at":"2026-08-06T14:19:45.082859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.699166Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":"3382d291-4adc-47f9-8fac-3b82234944b5","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.435318Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:85eee6f65c0013dcec0133720e9cba1083946c2b584c2c75c343eb8381f86984","observation_id":"fc7d881a-c0f5-4e22-b453-0570dc9067a9","resolution":{"observed_at":"2026-08-06T14:19:44.828041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T14:19:36.552673Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.552673Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:24a17597c933145b3dea31efb48dc06c4a831d06a6866754dd1d7393dcc5be4d","observation_id":"ca092a3f-da64-4fc2-aee2-c549055601d9","resolution":{"observed_at":"2026-08-06T14:19:36.552673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.468337Z","title":"Hiera: A hierarchical vision transformer without the bells-and-whistles","venue":null,"work_id":"734f17e7-15e6-4e12-a633-a178ba883a90","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.644218Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a353b4262815cf857875d1cf732f7bd3b4e6ae78c5a9153ed4e72673b8af60ae","observation_id":"5c03be5e-3b00-4980-88c4-78066345f1ff","resolution":{"observed_at":"2026-08-06T14:19:44.575409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.243460Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"3fd77734-236d-487c-8ec8-dbf9904e6995","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.749964Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1097704d24d2147e9bc101e097bf7ba5a2ae40783335c728e64de7fb1ee666db","observation_id":"297c4461-aa4a-413f-8cf5-41104126d5c6","resolution":{"observed_at":"2026-08-06T14:19:44.344740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-06T14:19:36.979072Z","title":"Gen- erative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.979072Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:143c0d0c2a9fa5e602fdbc45721b674023a1270818e4605f94729caf21d288d6","observation_id":"624e5f94-9f0c-470f-acef-f2167f960c44","resolution":{"observed_at":"2026-08-06T14:19:36.979072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.775241Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"c5f9ea95-134e-4fba-a6bc-ebf44bc4e952","year":2015},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.123600Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:0b1aecdeea9c9862d2d8531a83399ecf70848b46fbc5661672be8baf25dad309","observation_id":"1b464f74-7deb-44c6-8ad2-d543e84718e8","resolution":{"observed_at":"2026-08-06T14:19:43.856383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.494834Z","title":"Ov-vis: Open-vocabulary video instance segmentation","venue":null,"work_id":"72897b23-c161-45d1-9d41-087c66dfe681","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.236690Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:6a059da8f6bd5c2bb345a7e6aee5ddead0a15b0db96c5efdae6d296ce6ffaf86","observation_id":"bc9be667-cf9b-423a-94e6-5f3465b07219","resolution":{"observed_at":"2026-08-06T14:19:43.599672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T14:19:37.356424Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.356424Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a98ccf045f295f96baaa1625331739daf4316d9ea2606005f2cae0207a4c23b4","observation_id":"a4c34e4a-92bc-43f1-8a2c-09516a9bef1c","resolution":{"observed_at":"2026-08-06T14:19:37.356424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.244037Z","title":"Unidentified video objects: A benchmark for dense, open-world segmentation","venue":null,"work_id":"97160fc5-89f8-496e-b764-c3f03511a3e0","year":2021},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.497702Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:0a54dd24cd984764efb5ecd442dcede5ca7fe18b3947d61766e01e2605a0ef70","observation_id":"ff284c6b-ee5d-44f0-b956-a21b58c65482","resolution":{"observed_at":"2026-08-06T14:19:43.351712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T14:19:37.661534Z","title":"Internvideo: General video foundation models via generative and discrim- inative learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.661534Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1a26e861ea6d0d622a12a03a47859503b1309c5ea93a827a2ddeff6f2487a892","observation_id":"6a9aaa68-a589-4f06-9676-baa83d4ef10e","resolution":{"observed_at":"2026-08-06T14:19:37.661534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.015353Z","title":"Internvideo2: Scaling foun- dation models for multimodal video understanding","venue":null,"work_id":"85caa222-527b-4117-838c-f8e96c880524","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.795167Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:5da8b2d7c1c9e0e93fb182bd079fd494bd4c0021de3fe50358aa6c8f31e8c6b8","observation_id":"177d8f52-5c82-4d46-86ca-5d8315692384","resolution":{"observed_at":"2026-08-06T14:19:43.127670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.826830Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"b08133b6-9450-4a2e-9678-d06760b02f66","year":2021},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.926811Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1634bc323bb9390aaa27fa430a20056c50d96da1342c0464fc7d620375ed108f","observation_id":"ff67cfcd-c3e3-4eb0-bb9c-114846a0b438","resolution":{"observed_at":"2026-08-06T14:19:42.919131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.605795Z","title":"Visa: Reasoning video object segmen- tation via large language models","venue":null,"work_id":"b79aa36d-eefd-4d33-9159-c5ef75c2ca86","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.024130Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:eab8abe53d2e4a39663cdf781b8afad36419e6339c21ed9ba003ad4d3d517bd6","observation_id":"872524ac-7cfc-420a-a0ea-c0d3541c37e5","resolution":{"observed_at":"2026-08-06T14:19:42.729703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-06T14:19:38.109831Z","title":"Videogpt: Video generation using vq-vae and transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.109831Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ef250ef1efb54bcca6a96d5cbe7ef61c7d4b964b63c6ab253dd6333db4f0df47","observation_id":"455e99f2-4c90-42d3-be2f-6e87c41904f0","resolution":{"observed_at":"2026-08-06T14:19:38.109831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T14:19:38.229151Z","title":"Set-of-mark prompt- ing unleashes extraordinary visual grounding in gpt- 4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.229151Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:935b90dbe8f48742f604881f6bd90141226b51b17b4a3e5324d2354c5666917b","observation_id":"44a2257f-8dea-4cd1-8131-6d0e80f5ee68","resolution":{"observed_at":"2026-08-06T14:19:38.229151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-07-31T19:08:37.289553Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T14:19:38.352762Z","title":"Lisa++: An im- proved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.352762Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:bb341526b8838f41af6d44c29b00c6acd82c33c7f53a3573f0fb3065a59d7bbc","observation_id":"827c5a9c-da2c-4dd7-80b6-f910464b5d2e","resolution":{"observed_at":"2026-08-06T14:19:38.352762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T14:19:38.498533Z","title":"mplug-owl: Modular- ization empowers large language models with multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.498533Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:b81563a96b4b7e60679f024878a3f4310cca6bf825c115dcb21f7d8816ac3245","observation_id":"cb2f858e-5f53-4f4b-b6dc-fac94a69787c","resolution":{"observed_at":"2026-08-06T14:19:38.498533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T14:19:38.603030Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.603030Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:09d287e5c0dcb169855234e70a4225dc216093548a8c9651b3d312e353557063","observation_id":"dd125f56-671f-4185-abee-9e1900f90ef0","resolution":{"observed_at":"2026-08-06T14:19:38.603030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:38.745855Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.745855Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ee7d03ed08f2acae597d0df4f474f05e4c2c3811578c8f2a6f73f1f296bba0a4","observation_id":"450421f4-78e9-495d-b65b-092441bda764","resolution":{"observed_at":"2026-08-06T14:19:38.745855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.377991Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of im- ages and videos","venue":null,"work_id":"5d0f235f-2a46-45e5-b407-234be0f71993","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.813448Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a48f0af58d56f20cf6d64db12020ff16a2d9817f3c85798982429eed1ba30f5b","observation_id":"972d9ea1-6637-4f61-8713-1686d8528fd1","resolution":{"observed_at":"2026-08-06T14:19:42.467851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.166330Z","title":"Os- prey: Pixel understanding with visual instruction tun- ing","venue":null,"work_id":"b335571d-09f7-4d51-8a10-2e12b54d19e9","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.918347Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f6e5d800f393dbbbc7c87d250319e97ee4aadacc0130fa632454dafb75070ec8","observation_id":"a545401d-1949-49a9-8bc6-1d7869e20b88","resolution":{"observed_at":"2026-08-06T14:19:42.256487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.876494Z","title":"Videorefer suite: Advancing spatial-temporal object understanding with video llm","venue":null,"work_id":"7ac50c5c-1516-463b-b72e-f9fd8084d459","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.024526Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:e4fe67f26ded09c857c5da5f72e13cf1402f89f0e35b52096f0ce3d3f5faefd5","observation_id":"ccf18085-1bfe-4023-b3b1-542b44531262","resolution":{"observed_at":"2026-08-06T14:19:42.021520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T14:19:39.140269Z","title":"Vide- ollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.140269Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:8e59077a3c255f9e829b07f46a1f7ef800372a8b0afffcf2261f2b0f9a9db56f","observation_id":"025328a4-de54-48dd-bb8d-b7f8679de765","resolution":{"observed_at":"2026-08-06T14:19:39.140269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T14:19:39.258349Z","title":"Video- llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.258349Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:421136ba366b1bf69330670b94c77007a41a577369ebfe21d335df9c902e223f","observation_id":"b7f6f91c-70a2-46e0-adda-b72c587b9531","resolution":{"observed_at":"2026-08-06T14:19:39.258349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T14:19:39.360265Z","title":"Lmms-eval: Reality check on the evalua- tion of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.360265Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:55db6fcd0dc04c77c01add3bb6a32c7d02a23416bef6490ff48e9e660a5993fa","observation_id":"99f4e4f6-d6ea-447e-b0c2-7f198124978f","resolution":{"observed_at":"2026-08-06T14:19:39.360265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-07T18:00:59.339869Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-06T14:19:39.474732Z","title":"Gpt4roi: Instruction tuning large lan- guage model on region-of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.474732Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f2424774d6bc5a7db39d76be03180c0d248e4e095805f29941ee9e6c0441a29a","observation_id":"b5ee245e-d564-4974-a412-7de86e962e88","resolution":{"observed_at":"2026-08-06T14:19:39.474732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T14:19:39.606964Z","title":"Video in- struction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.606964Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:d158ca01fe4b213ab3b585943cd8dc544f0887f56728e79a7fed26577bbfe241","observation_id":"67cb2719-8b81-48f7-adeb-ca73373abd9c","resolution":{"observed_at":"2026-08-06T14:19:39.606964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.663233Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"5b1e3509-7904-4d82-835c-a1e099d5ee0b","year":2017},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.713362Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:2caa6440720a8f5dfb577465ed50d4a883b69b0f28acc64b128d6f7dcbbd3f35","observation_id":"0d770155-febd-4a35-a8c6-8d9ae90f717e","resolution":{"observed_at":"2026-08-06T14:19:41.775584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T14:19:39.834178Z","title":"Minigpt-4: Enhancing vision- language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.834178Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:7d9a15a029e5b446674588c6f91315caae313d842024c828920c21d15da5be47","observation_id":"f836cefc-0b8a-427a-9a92-f9483ff2bffc","resolution":{"observed_at":"2026-08-06T14:19:39.834178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.376205Z","title":"The complete list of used datasets in training is presented in Tab","venue":null,"work_id":"336ad50f-20b2-4d31-a702-5b2a8be9c7c4","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.976573Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:6cc80133327fafa55a88b524e558a3708a83a83389f5da75e13886f0418dc80f","observation_id":"b64863f9-c6e2-441b-8d25-9f17e8265ac1","resolution":{"observed_at":"2026-08-06T14:19:41.512014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.119133Z","title":null,"venue":null,"work_id":"eaf8e5df-4925-45e5-a781-49c0b38e4e63","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:40.126377Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:59459fe26c9abd13c9913643401f246cdf61ee787ea39fb97468585e0bb2d760","observation_id":"129b29ba-459e-434b-8336-2757de218c6a","resolution":{"observed_at":"2026-08-06T14:19:41.268991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:40.851904Z","title":null,"venue":null,"work_id":"bf768624-6211-449c-9af3-e8b55a54b314","year":2000},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:40.237501Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:29d0e475956afb72f6ee3ec36ab1aaf1bdfd188aee53f079dc6285780763ce2f","observation_id":"b5b5aa3e-f768-44d4-b4c0-9b6077d8db28","resolution":{"observed_at":"2026-08-06T14:19:40.965085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.965768Z","title":null,"venue":null,"work_id":"5c64d899-2ef3-4d84-b2db-a7c4b6ac3b08","year":2020},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":223,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.874703Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:b1feafe11c074acaf0bbe95acf085bbf5c81f799e17ba001b0544d1397ad276b","observation_id":"c21f2be1-ac58-4b45-9031-bf31ee57b6f1","resolution":{"observed_at":"2026-08-06T14:19:44.107775Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":35,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2507.19599."}