{"as_of":"2026-08-13T04:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3ffa6af3f5055c9badd8dba85403379725a4deee7b23c870e61bb2ade8210af","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:40:11.801366Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18042/citation-record","integrity":"/paper/2411.18042/integrity","json":"/paper/2411.18042/citation-record.json","paper":"/paper/2411.18042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.388492Z","title":"Hypergraph convolution and hypergraph attention","venue":null,"work_id":"1906623e-7a5a-4124-b093-a35b3e2c81d8","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.625565Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:5a7320ea130bcd9e676d6210e339a8ba68284f2445dd15e01b6c4e03920341bc","observation_id":"47065bf6-c82b-4a38-83cb-0cb97e130433","resolution":{"observed_at":"2026-08-12T11:40:12.392037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.377632Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"e4cec180-e843-4e7f-bd36-3d99901b30a0","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.629550Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:ed533d9e6ce25a9eec265f6e313eb10d38c7132a55b4bea0ae024fbdc95f173c","observation_id":"3fffe994-affe-4e0b-b88f-7f3aeef8e442","resolution":{"observed_at":"2026-08-12T11:40:12.381702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.365623Z","title":"More knowledge, less bias: Unbiasing scene graph generation with explicit ontological adjustment","venue":null,"work_id":"688af6c1-b52c-497d-9ac9-7f38d2f11cdb","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.633239Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:37c635032efc8eac74b3a6e84476c344165f747cda0d84ad2c6d4f8430d4fc32","observation_id":"e57cda53-1446-4962-940d-9e02f05f2b2b","resolution":{"observed_at":"2026-08-12T11:40:12.369568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.354743Z","title":"Spatial-temporal transformer for dynamic scene graph generation","venue":null,"work_id":"3107ab42-df88-4f7c-883e-edc923929ee3","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.636717Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:855a7fb9b7308ab2a47d4909b007f240d1c2621d1e1dd0ed5fa512b98d05637c","observation_id":"e2cc69d3-f843-4699-b747-efe145e9f620","resolution":{"observed_at":"2026-08-12T11:40:12.358675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.343884Z","title":"Ackermann, M","venue":null,"work_id":"d519abcd-d471-4b5c-9b41-b531e0ff39cf","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.640397Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:af4ccd9b879c60898ac70105b88dec05428e6e467c3487079513c1d3ab68184f","observation_id":"2a51eb02-5c8e-44c1-822c-5f419c2817ab","resolution":{"observed_at":"2026-08-12T11:40:12.347723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.333047Z","title":"Reltr: Relation transformer for scene graph generation","venue":null,"work_id":"697bcde3-75ca-43db-a0c7-0320882608c5","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.643538Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:eb1a646d13371436b70214fa9bce452edb50500e9a2d6a5d26b2fb0e62910b2a","observation_id":"3ce94ce0-09b0-488d-a642-7b18dc786a08","resolution":{"observed_at":"2026-08-12T11:40:12.336791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.322561Z","title":"Hierarchical memory learning for fine-grained scene graph generation","venue":null,"work_id":"0d6f1a80-81a1-4868-8998-beb01c9317d9","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.647193Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:36c54a9487b660cd0a07421549d409452070db1b16adc5ef1d02219f53c99029","observation_id":"eae8c831-eb9e-4575-be7d-726f47a1e5f8","resolution":{"observed_at":"2026-08-12T11:40:12.326254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.650339Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.650339Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:83ca766e0056dc1d7df253568247f418b1098ea0e0b101013c5c0853e0831141","observation_id":"cb1589d1-b33d-4b17-a07c-1044dafb324e","resolution":{"observed_at":"2026-08-12T11:40:11.650339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.306007Z","title":"Scenegenie: Scene graph guided diffusion models for image synthesis","venue":null,"work_id":"bf803158-a543-4a7c-b4ce-c87b5c543d59","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.653625Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:0ee72273cb4597d5d95cd277f41139705c0346143e48efb1c9c5be10aa5b85b9","observation_id":"624edd82-801d-4d26-9f0a-eebc06b1ba41","resolution":{"observed_at":"2026-08-12T11:40:12.309576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.656639Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.656639Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:f03f89cfb6f563e4812e0d6a02235dcd41b4d72351a5974e860d62a20a707ae8","observation_id":"c02c7e11-a034-4c46-a231-70cf92943165","resolution":{"observed_at":"2026-08-12T11:40:11.656639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.289098Z","title":"Exploiting long-term de- pendencies for generating dynamic scene graphs","venue":null,"work_id":"2453bf8a-e2b7-4372-80ad-f3381fcd20f8","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.659791Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:5d079d811202c1f41c8f05474a5ad580c9c191032c585f9f1b490db3e0b481a5","observation_id":"a1d631bd-6223-43e4-b95d-70028c99abf9","resolution":{"observed_at":"2026-08-12T11:40:12.292900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.279161Z","title":"Hgnn+: General hypergraph neural networks","venue":null,"work_id":"7f1854dc-a70f-49d1-b378-622beedd8ace","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.662934Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:5657804e43438a1416980590791e0be7c1754f0ac749c806e6635f6dc807ffd5","observation_id":"e3c3b222-8cc9-4a68-b00a-4a108bac65f7","resolution":{"observed_at":"2026-08-12T11:40:12.282557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.269499Z","title":"Dsgg: Dense relation transformer for an end-to-end scene graph generation","venue":null,"work_id":"a0c6cfeb-0512-4b9c-80f6-defb7712df42","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.666336Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:dbc0d3f9b4bfb585701cef971ce25d649c594b44650b5e46fc8b05ed94ea2cc3","observation_id":"abb515da-5988-445a-9e06-a141f4cdf504","resolution":{"observed_at":"2026-08-12T11:40:12.273196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.259682Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"4579ea53-5f21-4226-bfae-50a58c8b922e","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.669390Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:e562366ce6834b9fde48899a866015138110ec87fee18494ac48efa739abcdfa","observation_id":"3a282eb0-6309-40d6-b19c-0668cc00aebc","resolution":{"observed_at":"2026-08-12T11:40:12.263214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.250118Z","title":"To- wards open-vocabulary scene graph generation with prompt- based finetuning","venue":null,"work_id":"0ed17e13-dabf-4166-b0ee-816da88ca879","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.672533Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:1631a065391e710fd1c1a301f291717a3d5d41e317f45682a3bcd4cd0baae043","observation_id":"35f44b0c-252b-41e2-91aa-b900a58ab44e","resolution":{"observed_at":"2026-08-12T11:40:12.253635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.239783Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"e48c1465-f13f-4d59-a026-56d8f6299eee","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.675641Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:c6c3dafa3d8740f9c1fa25ea33066dff7c1600faef48da0e691a83d0e73f6d00","observation_id":"fce694f8-487c-4612-8ebe-41fdc8973608","resolution":{"observed_at":"2026-08-12T11:40:12.243528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.229647Z","title":"Egtr: Extracting graph from transformer for scene graph generation","venue":null,"work_id":"4902edb3-5dfb-4964-ad78-63fd665d77ec","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.678539Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:2c9dbf46373835a8c281bae00c5b971684bc9a1b0780eadee46aa81b536682c2","observation_id":"dd832ab9-00e4-405c-89a0-d5c5ff3fa723","resolution":{"observed_at":"2026-08-12T11:40:12.233211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.219303Z","title":"Action genome: Actions as compositions of spatio- temporal scene graphs","venue":null,"work_id":"fefdf31c-9966-421a-b6ec-2506081256be","year":2020},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.681543Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:22adcd240ff483c3e677ff281486a00cbe8bd0e837e33b85a0625c216bf1c4d9","observation_id":"dbb05071-bc4c-4093-88b6-3401cf45f503","resolution":{"observed_at":"2026-08-12T11:40:12.223103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T11:40:11.684649Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.684649Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:c064702d7e060a6e011e14ab2833efc9989cded24bb462dda9d41112c05fd10a","observation_id":"1a81f79c-35ab-4c20-9abe-4c77757cc8fe","resolution":{"observed_at":"2026-08-12T11:40:11.684649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.208613Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"0527ac90-a9c3-4fea-bbfb-f8db1f64b73c","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.687984Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:cac5a8d997e51997e0d5574b34a0250a51c699e2f1781e072aa4c078bb29ba10","observation_id":"69bff302-d15e-4f3a-a07b-8902f6468fe0","resolution":{"observed_at":"2026-08-12T11:40:12.212339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.198252Z","title":"Fast contextual scene graph generation with unbiased context aug- mentation","venue":null,"work_id":"a8acd595-7035-41ef-b51e-c8f64d734236","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.691172Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:6dd339a8fc9f19c01ce3afbb2a9924bcabc8d56e26c2a4e2fd2e8a1ab3e7013f","observation_id":"af617414-a1fa-4627-9ede-42e9f586d84f","resolution":{"observed_at":"2026-08-12T11:40:12.201942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.186738Z","title":"Hypergraph attention networks for multimodal learning","venue":null,"work_id":"64ed6d37-71f0-443d-9e09-1a062607a007","year":2020},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.694326Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:3d95b1289d7c1ad796e3e13763ede031221ee5018c922d3c524a8821f9bbb708","observation_id":"e0a53f0f-6f68-4fdb-9fce-b20b3af2ddce","resolution":{"observed_at":"2026-08-12T11:40:12.191231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.175630Z","title":"Llm4sgg: Large language models for weakly supervised scene graph generation","venue":null,"work_id":"9b9afd04-d3ca-4b21-be37-a63f89476854","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.697499Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:eddb6eb0bc1dd807ce8881e310dad8afcaa808760f9885b0213de39e8ac004f1","observation_id":"be49426a-84ad-495c-b1e9-a4722b4eaf12","resolution":{"observed_at":"2026-08-12T11:40:12.179420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.164208Z","title":"Meltr: Meta loss transformer for learning to fine-tune video foundation models","venue":null,"work_id":"561e8d57-b779-46f2-a7c9-d5b902c69c70","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.700453Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:6051110a79ea6175c8c2cd9cdbb932fcf4a93e5efaf384b1b47e5539f077e588","observation_id":"ed214bf8-3954-4a29-8a1d-78e67a529f69","resolution":{"observed_at":"2026-08-12T11:40:12.167980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.152940Z","title":"Is-ggt: Iter- ative scene graph generation with generative transformers","venue":null,"work_id":"d8ebc2be-2e67-4afd-bc0b-6d22aaeb71be","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.703973Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:09b591b7c92e698ab9c1f140798e2cf5d80e50fa13c0de948e6b450e0ce29ed4","observation_id":"122f1242-8c7f-46a9-b262-f5d27a22d05a","resolution":{"observed_at":"2026-08-12T11:40:12.156650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.141876Z","title":"Sgtr: End-to- end scene graph generation with transformer","venue":null,"work_id":"5a13bcb9-db69-4e34-b330-3923e3676891","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.706987Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:a3eacc54bbaaf9005a9d380fb410a98f2c9987d72de36790947a637cba1be1cf","observation_id":"14d346c6-e123-4ec5-a6ad-dccb7e176c8e","resolution":{"observed_at":"2026-08-12T11:40:12.145820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.130023Z","title":"From pixels to graphs: Open-vocabulary scene graph generation with vision-language models","venue":null,"work_id":"87069da0-3024-4f00-9a00-4f80dab9b5d6","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.709978Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:39c1d09b77cdef2a313416a619d09b5757463d045042ae756f4bad10fabfed39","observation_id":"678fdedf-9106-4dcc-bb01-31ad0f8c83ad","resolution":{"observed_at":"2026-08-12T11:40:12.134126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.117551Z","title":"Multi-hyperedge hypergraph for group activity recog- nition","venue":null,"work_id":"59e97aa5-99df-4b98-95a0-1f92cec51953","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.713154Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:1e4e5e2ff595113006d258621133e98b834853c13202f20e1d38740e6c610ff3","observation_id":"c653be38-eeb2-413e-9ae3-b5fc4bf7e91f","resolution":{"observed_at":"2026-08-12T11:40:12.121622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.716455Z","title":"Llama-vid: An im- age is worth 2 tokens in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.716455Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:72f2b37973e481f7f7861dff233429be28c1db51e95c76d87cacd33217d053c6","observation_id":"3dd7730f-4d50-4014-b593-ade9d5efe097","resolution":{"observed_at":"2026-08-12T11:40:11.716455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T11:40:11.719560Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.719560Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:8d93de5ae120889776074c0001bdbc1e00562911155a9abf0b46836fd6d1d60d","observation_id":"e9a5e21d-2e42-4b47-b768-946cb4341916","resolution":{"observed_at":"2026-08-12T11:40:11.719560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.723112Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.723112Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:739c109a81eda7f1fa7c16738f57556ff571b447e82c7174a8869f66bf8f260e","observation_id":"c6ffef97-4752-4e00-aeba-5952917530bc","resolution":{"observed_at":"2026-08-12T11:40:11.723112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.093039Z","title":"Video-ChatGPT: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":"08795676-c9be-405f-b0ac-378b16faf28b","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.726132Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:237faafb305188f7f0956748c5b8381e9676a1fd22c7f295f9c7151bc2f2ea81","observation_id":"88ef27fa-b2d3-4130-b70a-3b1999f51b22","resolution":{"observed_at":"2026-08-12T11:40:12.096830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.729141Z","title":"Unbiased scene graph generation in videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.729141Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:a7b27dbdc23e57f5214d0b33c9df8892be7ef6d7c9798b76e63e13750f4702d8","observation_id":"c2b6801f-8bbe-4f0c-b60e-832c028e9862","resolution":{"observed_at":"2026-08-12T11:40:11.729141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.075209Z","title":"Hig: Hier- archical interlacement graph approach to scene graph genera- tion in video understanding","venue":null,"work_id":"3e77478c-abfd-4bd7-bc10-4092001842b6","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.732293Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:0aac40a5625242c0eff86d5fdc80c940df46e8d463e438f7a3e41f4be9f87d3f","observation_id":"e71a3228-b3b2-4a8a-aa8b-b1d050f1bdf9","resolution":{"observed_at":"2026-08-12T11:40:12.079157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.064822Z","title":"CYCLO: Cyclic graph transformer approach to multi-object relationship modeling in aerial videos","venue":null,"work_id":"cbf7eaa7-dde2-41a5-9254-aed81628a4eb","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.735700Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:42528781ca6e7aaaab82a1a88c9fc3d3d8931c69455e80014c43b5b66c3051ab","observation_id":"6dc50a18-e6fe-471f-bd90-5d1782f195ab","resolution":{"observed_at":"2026-08-12T11:40:12.068554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.054476Z","title":"Towards scene graph anticipation","venue":null,"work_id":"67c0fc1e-2a92-48f5-877b-35298848a0da","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.738760Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:338e47e99fc9ff1e1602394d9773184116da448f462b684f1be70b74ff089173","observation_id":"632c9d99-f2d7-4fd6-826e-b8b36c51dcb5","resolution":{"observed_at":"2026-08-12T11:40:12.058213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.742043Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.742043Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:4fe31356c898c64126da73eec517e483aa4d8cc504e63fb423f39912d9990433","observation_id":"e6aa5901-1745-4fa5-adce-ec8adc53a763","resolution":{"observed_at":"2026-08-12T11:40:11.742043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.037598Z","title":"End-to-end generative pretraining for mul- timodal video captioning","venue":null,"work_id":"ce2ab344-d097-4ec4-8820-674894f825d1","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.745174Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:2b852991663ca67426e60c1fff76ce6e1a51bd7ee0d6e1589dc142d16b296f4d","observation_id":"a4b17a51-1bd6-499c-aa56-5f99904911c1","resolution":{"observed_at":"2026-08-12T11:40:12.041092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.027178Z","title":"Video visual relation detection via iterative inference","venue":null,"work_id":"9a8c9470-8925-4bdc-8e7d-0b37ecbee8a9","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.748488Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:fcfa53d123e4b24ffac2776e59ac0b17f763a243b71e4f14a21bb530b3faa0d4","observation_id":"04acd1ce-0c51-4757-b1f8-f9aedbac0671","resolution":{"observed_at":"2026-08-12T11:40:12.031049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.017268Z","title":"Accurate and fast compressed video captioning","venue":null,"work_id":"6afd9e81-b889-46a2-9a01-aaa0ad4ac2b9","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.751749Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:9b2b511c4295fc3fc20a584b5af728617c68650ac1b7690d3eabe345c8b95c13","observation_id":"9d8f892a-9069-4d49-8684-7cbfe8e12d83","resolution":{"observed_at":"2026-08-12T11:40:12.020659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.007000Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"c881e399-15f9-4ef8-a82a-8f52414cdd42","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.755047Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:5153c374a2de78ac29bd85528c584cc12a67f064e98499fbb341772926563d41","observation_id":"d58efe02-a84b-40a5-b2f8-2be33f1eb6e5","resolution":{"observed_at":"2026-08-12T11:40:12.010721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.996722Z","title":"Target adaptive context aggregation for video scene graph generation","venue":null,"work_id":"a52563aa-e0e7-41dc-853b-7269ed96c940","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.758254Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:83e367512006610eacf42597de236ff754074180e130042946186195b42b9169","observation_id":"46e1f0bf-d5b5-464a-90e9-448b0d6fa014","resolution":{"observed_at":"2026-08-12T11:40:12.000180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.985220Z","title":"Graph (graph): A nested graph-based framework for early accident anticipation","venue":null,"work_id":"cb7e4ceb-da28-4fb5-800c-8825c4fe2ac5","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.761527Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:c182047ff713edc8f9feed41d49aae686f91a471f4025e24467314d9ad0c50e9","observation_id":"f155b570-1bb0-4e87-87c8-fc5eac1d0210","resolution":{"observed_at":"2026-08-12T11:40:11.989815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.974857Z","title":"Learn- ing situation hyper-graphs for video question answering","venue":null,"work_id":"236376d8-ed44-4f1b-92e4-aaf23eb13cef","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.764843Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:acc3d55f251fe478a4735018b11d7ce9706ed931cafa06de4ce091862f1b6412","observation_id":"c263d043-ef2f-4707-9e70-cc2bf9417461","resolution":{"observed_at":"2026-08-12T11:40:11.978542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.964398Z","title":"Memory-and-anticipation transformer for online action understanding","venue":null,"work_id":"03af728f-56f9-439c-a213-8bbe914ea0c8","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.768319Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:b1aa00dd58a5846eaafe8526e56d6eb2bd597d6e3eb3a73fafbf3ce064c53ff1","observation_id":"7d11a638-a48c-4f40-87c3-ffe7d109c8cd","resolution":{"observed_at":"2026-08-12T11:40:11.967979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.954099Z","title":"Multi-object event graph repre- sentation learning for video question answering","venue":null,"work_id":"c43ce409-b862-408f-af79-16569f85e7d8","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.771576Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:af66127475985483393539c43b471e53662a17ea1721bff82ecb8fa0467ddeaa","observation_id":"00d9865b-6361-4fb8-a353-973ec02d85f1","resolution":{"observed_at":"2026-08-12T11:40:11.957733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.943932Z","title":"Sportshhi: A dataset for human-human interaction detection in sports videos","venue":null,"work_id":"b9e32162-dd73-4dbf-80e8-3c44bc8ae738","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.774727Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:8271e252b763cb3acf3014af50bb8326a159547d978c563f7844e4bf7d1cf627","observation_id":"57976c3d-6af9-4e07-a3a9-d08a700d8591","resolution":{"observed_at":"2026-08-12T11:40:11.947740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.933219Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"c693ddf4-9daa-4a12-9451-27f54e450024","year":2017},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.777987Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:e7c52a96770f175977325b4fa51fca4c18bc947f7579ee53dc82c5329e0b09d7","observation_id":"c78aff94-a7f9-433b-bc76-f0b170dc9cf1","resolution":{"observed_at":"2026-08-12T11:40:11.937103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.922279Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"febc5545-ac55-4a9f-9a5f-8dfaebc51c6f","year":2016},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.781122Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:e7c19f45b84a1d7ad0b1c913d67c8d24bc9eb51cd1e140eef6328217bc9e9a9a","observation_id":"7df030ff-5c41-4ee2-853d-b5466221abbc","resolution":{"observed_at":"2026-08-12T11:40:11.925868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06530","last_updated":"2022-05-13T09:28:13Z","snapshot_observed_at":"2026-08-09T07:20:19.698355Z","submitted_at":"2022-05-13T09:28:13Z","title":"Modeling Semantic Composition with Syntactic Hypergraph for Video Question Answering","version":1},"cited_work":{"arxiv_id":"2205.06530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.06530","snapshot_observed_at":"2026-08-12T11:40:11.847386Z","title":"Modeling Semantic Composition with Syntactic Hypergraph for Video Question Answering","venue":"cs.CV","work_id":"c2947f76-debb-417f-92b2-870b350de4e8","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.784273Z"},"links":{"cited_paper":"/paper/2205.06530","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:9d6247e891bca695ec30fa1fafb53e61295a0b1a0a18767c6e18520297736334","observation_id":"dd1b7835-bca9-40df-affc-aefa92f06ec2","resolution":{"observed_at":"2026-08-12T11:40:11.851397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.911377Z","title":"Panoptic scene graph gen- eration","venue":null,"work_id":"f2c22d01-1357-42ee-a25a-cdbf2226e7dc","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.787854Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:7b09e626f6ab79e8b7a3d08f3cc37a5239c5d721eb8855a13c35551541b9a22c","observation_id":"94a755fd-e3eb-4251-a8da-e815d2573e0b","resolution":{"observed_at":"2026-08-12T11:40:11.915015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.900977Z","title":"Panoptic video scene graph generation","venue":null,"work_id":"fba0ca2f-83fe-4ef5-9266-b00fc3a00fdd","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.791005Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:d8c648990df4bacdd0108bb57e747030f81bb123d3d492a865ac78a76d1a57bc","observation_id":"f8d8afc5-4a8d-44ef-bfa8-e264f5a645e9","resolution":{"observed_at":"2026-08-12T11:40:11.904504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.890217Z","title":"Com- monscenes: Generating commonsense 3d indoor scenes with scene graphs","venue":null,"work_id":"afa2b506-c78f-41eb-87ed-053da291b881","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.794627Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:1321e12f1cd5c6fa7d7b5f4fc25eb617fa7894bb0672185dbb62e2efc40972e2","observation_id":"d433d7f4-a8b1-45cd-ba43-38688d6b0d7e","resolution":{"observed_at":"2026-08-12T11:40:11.894101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12547","last_updated":"2022-08-26T10:00:11Z","snapshot_observed_at":"2026-08-12T11:02:14.806942Z","submitted_at":"2022-08-26T10:00:11Z","title":"Deep Hypergraph Structure Learning","version":1},"cited_work":{"arxiv_id":"2208.12547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.12547","snapshot_observed_at":"2026-08-12T11:40:11.831246Z","title":"Deep Hypergraph Structure Learning","venue":"cs.LG","work_id":"5280597b-d835-4054-ad61-3cf3371d74f5","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.797897Z"},"links":{"cited_paper":"/paper/2208.12547","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:ac0662cba9c530e4a3aa69ce99eb16a0cfded8575cb51d70fd9abe80118575cd","observation_id":"0296fca6-0715-471a-82e8-c6feebf07dc0","resolution":{"observed_at":"2026-08-12T11:40:11.836662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.879214Z","title":"Dynamical attention hypergraph convolutional network for group activity recognition","venue":null,"work_id":"aff4be1e-2eee-4d99-83e7-5e9d67991f7a","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.801366Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:0da3a3012b5b9d537d2852f138bbeb8e60867ed14a4ecdfe7e533fa4c57f25b7","observation_id":"90307944-824b-4c20-ab2b-c6dfddcb7f3e","resolution":{"observed_at":"2026-08-12T11:40:11.883196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T03:25:03.166416Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2411.18042."}