{"as_of":"2026-08-21T20:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ce1f41ce3a8b45d2be843fe45b5a199d8bc35085f91400cd8db06e89b5269fb","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:59:50.316255Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.16761/citation-record","integrity":"/paper/2504.16761/integrity","json":"/paper/2504.16761/citation-record.json","paper":"/paper/2504.16761"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.120841Z","title":"Deep learning approaches on image captioning: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.120841Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:ffa6098269b091364e1080ce3fa96651be001bb8e66b4bffcc6fc703756dcd27","observation_id":"2e1cb311-37ca-4359-b927-c7ab66e21405","resolution":{"observed_at":"2026-08-16T10:59:50.120841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.889145Z","title":"From methods to datasets: A survey on image-caption generators,","venue":null,"work_id":"b08f38b6-ce64-4674-8ee1-e4a24bf49d6a","year":2024},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.127279Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:ef650117699b0b38be6f562f1c5088becffcd85185b0f46ffc880b9e53c74ee7","observation_id":"b7b0b336-bd7a-41e4-a778-0eb9cd830dfb","resolution":{"observed_at":"2026-08-16T10:59:50.893753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.132579Z","title":"A survey on vision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.132579Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:a6606f37320f0959f5402b7164e50f379750564237c60b45e191a0f3fb0d55a8","observation_id":"87fdbd8f-dce6-4cf8-a912-db90c75a14e4","resolution":{"observed_at":"2026-08-16T10:59:50.132579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.866303Z","title":"Text augmentation using bert for image captioning,","venue":null,"work_id":"b97060b2-3774-4a1a-974a-005c66c9be19","year":2020},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.137872Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:3bb1d0b7165e0c274211f6b0a25e0322cd87a09c364dea75331cd640f0761bdc","observation_id":"ffe5c0a4-8251-4e05-87b5-52ec63548431","resolution":{"observed_at":"2026-08-16T10:59:50.870814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.851803Z","title":"Contrastive language- image pre-training with knowledge graphs,","venue":null,"work_id":"beff979a-d8ad-4fe8-ba55-0518b91f8975","year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.143478Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:3bbb0276d9cde16d56e1a32347c092b949313a0a0b3c241a9a326dc64ceaf7dd","observation_id":"c73c811d-153d-4a05-9a24-71dcd9445b7f","resolution":{"observed_at":"2026-08-16T10:59:50.856515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.837332Z","title":"Entangled transformer for image captioning,","venue":null,"work_id":"e2a81c87-1638-4ab0-8611-f914797bc04f","year":2019},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.148733Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:06c216c9e514ae92d1c0bfa8a0d09716e0ac4f35000172236d6df236bfc209eb","observation_id":"796b4b33-25ed-4c19-875f-c9efd9dcf15b","resolution":{"observed_at":"2026-08-16T10:59:50.841837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.154037Z","title":"Meshed-memory transformer for image captioning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.154037Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:5561d3b37f82d7a5cbd88de72cd3750e78df66dd0d7370e2906c44a9d7d30cb0","observation_id":"50f91054-d0dc-4760-8b62-d836717ef205","resolution":{"observed_at":"2026-08-16T10:59:50.154037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.159043Z","title":"Multimodal transformer with multi- view visual representation for image captioning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.159043Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:580e55f3c5608d0c9cb17f5f4f5f7b4ce0bd23f2c921428c2fc6a0984a894a96","observation_id":"2ae568fc-702d-49ea-a29f-d76e962bfea7","resolution":{"observed_at":"2026-08-16T10:59:50.159043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.163495Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.163495Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:e8e130142c49c247cc1cbf1edede777d81763d55fc7dfd0c6e7b4609d7b5e01f","observation_id":"01d9fa9e-2d74-4b48-9bff-46ff8475adf6","resolution":{"observed_at":"2026-08-16T10:59:50.163495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-16T10:59:50.168472Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.168472Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:970104d56e51d77e79e4f502f0a16bd69eaba43d081ef68439affa14324363a6","observation_id":"6f91ecc6-80b0-4a38-9fe3-dbf7a1a2c04a","resolution":{"observed_at":"2026-08-16T10:59:50.168472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.794537Z","title":"Samt- generator: A second-attention for image captioning based on multi-stage transformer network,","venue":null,"work_id":"edaf901a-466c-45ea-8011-0c99083b9ad8","year":2024},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.174099Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:5ea2408e01d147b5402a458cd18d19c144c2f79b5821033d16a60bac7738e9e0","observation_id":"9df9c8cd-5337-4a79-860e-83625bfa41cb","resolution":{"observed_at":"2026-08-16T10:59:50.799177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.781100Z","title":"S2 transformer for image captioning","venue":null,"work_id":"b3f4122f-2adc-42a8-9bf2-95af20ffbdb9","year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.178706Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:cc4d7a1052363228e66098fb040191ae0c60354c0416ec8868cab5192c8be3a7","observation_id":"c7c0c7ab-4bfc-4e79-b76c-8d6c95c89611","resolution":{"observed_at":"2026-08-16T10:59:50.785470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.765470Z","title":"Ca-captioner: A novel concentrated attention for image captioning,","venue":null,"work_id":"3bc30eef-3a03-4114-8a98-137f0318665a","year":2024},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.182811Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:ab000ddcfca7ba2e1330caaf17e64bc6bb9c2cd462fe5669a160b1c805dccc38","observation_id":"835c1840-d3b7-49a5-a270-64fb83d1497e","resolution":{"observed_at":"2026-08-16T10:59:50.770415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.749779Z","title":"Image cap- tioning using transformer-based double attention network,","venue":null,"work_id":"9e8306d9-63a1-4ca5-9e2f-7320ebe3758e","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.187255Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:625457771e273c7f7d152b6f88e94c574df94c7ec49cd5a7a537a8d30935b1fa","observation_id":"53e8609a-4a5e-44a0-a4a2-b47043953969","resolution":{"observed_at":"2026-08-16T10:59:50.755184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.734610Z","title":"With a little help from your own past: Prototypical memory networks for image captioning,","venue":null,"work_id":"59bd0327-da68-4fa9-bcb5-a1ae570c21a7","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.192488Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:e7e37f2b5f0f96af51555cebb0a2f9c21430ee6d5ca1d8bc7ad252f1da1e4914","observation_id":"f6d96a6a-8c9c-40b5-89c7-3410ac9c3490","resolution":{"observed_at":"2026-08-16T10:59:50.739343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.720000Z","title":"Haav: Hierarchical aggregation of augmented views for image captioning,","venue":null,"work_id":"c65ea8f8-98ad-4a39-a444-2c17c0477105","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.198070Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:504222a754b0c82c2c6f2022cff69db405102e4a601c370b0fa064c56f65fbc0","observation_id":"a9809b41-cca4-45cf-9dd5-5876bed97e91","resolution":{"observed_at":"2026-08-16T10:59:50.725022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.703874Z","title":"Dual vision transformer,","venue":null,"work_id":"cc68c612-96c4-4c68-8c8a-5340fa433316","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.202445Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:e4eb8df2aa75674bdbe5dad8466689c590257d7a107385d6539168b61f09d619","observation_id":"9a3bed3e-b3c6-46b0-bdc9-31a73a0dd0b1","resolution":{"observed_at":"2026-08-16T10:59:50.709713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.689091Z","title":"Spt: Spatial pyramid transformer for image captioning,","venue":null,"work_id":"7e555a6c-292c-4e23-bc16-4c0a8e52edd1","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.206883Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:e4da5914d615d110ec76c8adce19931f815c91197c631e681a96b49a0a6593e3","observation_id":"fe0f43ed-15bd-42ac-b9c9-6adbc4859024","resolution":{"observed_at":"2026-08-16T10:59:50.693549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.211563Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.211563Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:56c5e9e472a702674afa11a11cb96571da174b4443d43f660e296095e22f29ad","observation_id":"e15e0415-71c3-4b20-b798-97944ec6a639","resolution":{"observed_at":"2026-08-16T10:59:50.211563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.216074Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.216074Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:96bfcec14973b1eee3967dfc5213e1d829f7048a41bb35465bcaacbe0cc32c85","observation_id":"430aab14-aa6e-4b49-b049-e57d8578222d","resolution":{"observed_at":"2026-08-16T10:59:50.216074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.654327Z","title":"A topic-based multi-channel attention model under hybrid mode for image caption,","venue":null,"work_id":"e880c60d-d144-41e3-9733-6c8b1051fb8f","year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.220542Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:ac79226a9db350cde9a8a332195a994a37361283773b6930664c720367278f43","observation_id":"a037e398-a076-4bfd-8ecf-67c5544adaec","resolution":{"observed_at":"2026-08-16T10:59:50.659361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.639240Z","title":"Transformer model incorporating local graph semantic attention for image caption,","venue":null,"work_id":"6be35e73-cd60-45d7-bc86-c7fa98d6ac5a","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.224647Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:e1eaa93802a1656c4a6d486d1fffb3e042b899a3c800a0352eeb839f56590478","observation_id":"9bfd8312-5085-4675-b998-0214f19a2c6e","resolution":{"observed_at":"2026-08-16T10:59:50.644315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.624703Z","title":"Dynamic-balanced double-attention fusion for image captioning,","venue":null,"work_id":"7539546b-d523-44e8-b817-1c8d202c32eb","year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.228795Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:14d8e439b4b16198d054bd886d495edde6c3532bba4a2a24e22b087c1ae5984a","observation_id":"343b0f64-5407-40fa-b452-aae5d9a44804","resolution":{"observed_at":"2026-08-16T10:59:50.629265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.609361Z","title":"Improving image captioning by leveraging intra-and inter-layer global representation in transformer network,","venue":null,"work_id":"f622a7f9-bd3e-4145-91f5-f768acd44326","year":2021},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.233363Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:a4b3a411f8f7c60ef7a630ebd300e2500cb3488e6db83665c8f587c58fc2abfd","observation_id":"74635107-53e3-4e22-8f17-3d180e6f0165","resolution":{"observed_at":"2026-08-16T10:59:50.614455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.594554Z","title":"Geometry attention transformer with position-aware lstms for image captioning,","venue":null,"work_id":"09fdf43c-c276-4c6f-918c-a9fb4d5e1aae","year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.238055Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:710fea4d18c6dfc542ca2dad9ec4adfce1b6e720e0ac200654769d047a20b4c6","observation_id":"0a3f1b45-9da4-40b4-a68a-9f61f8e7dd69","resolution":{"observed_at":"2026-08-16T10:59:50.599268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.243481Z","title":"Vision-enhanced and consensus- aware transformer for image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.243481Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:fcdc3bdd9ccc8009ab4b0255439d087be43d1854c60066f96e94cdbefca93437","observation_id":"540ef87b-320b-4f75-85fd-47163a910185","resolution":{"observed_at":"2026-08-16T10:59:50.243481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.571963Z","title":"A novel cross-fusion method of different types of features for image captioning,","venue":null,"work_id":"6f00e3e0-eef3-4d21-bad1-61f85b7c1527","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.248490Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:681e970bb5f8b7f785b81affb3f9cd476c09138ac99474e1d4210c483378b10a","observation_id":"f2e2bed9-5fae-4ef8-a674-cdf1488301c1","resolution":{"observed_at":"2026-08-16T10:59:50.576910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.557489Z","title":"Transformer- based local-global guidance for image captioning,","venue":null,"work_id":"ee5a32f2-44b9-4bd1-872e-66d4e2addacd","year":2023},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.253464Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:dd7ed9dc4797440ff9241ef082d8dff4d42cbd7d70d384e47065b45ac97bdc88","observation_id":"19673f21-c8db-439d-bf9b-9379c1a07100","resolution":{"observed_at":"2026-08-16T10:59:50.562334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6632","last_updated":"2015-06-11T15:26:58Z","snapshot_observed_at":"2026-08-15T10:22:07.704120Z","submitted_at":"2014-12-20T08:10:04Z","title":"Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6632","snapshot_observed_at":"2026-08-16T10:59:50.258035Z","title":"Deep captioning with multimodal recurrent neural networks (m-rnn),","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.258035Z"},"links":{"cited_paper":"/paper/1412.6632","citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:34b2efc329a19c7d115f916b5b157f35181530cf0248888304fc29f7e60efbc4","observation_id":"1f05575c-ef93-461c-92bb-6fa746ef6e96","resolution":{"observed_at":"2026-08-16T10:59:50.258035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.543267Z","title":"Re- view networks for caption generation,","venue":null,"work_id":"edf0196c-97e6-428a-b039-578bffaed216","year":2016},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.262490Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:b813031e9ce41ea36063efbfcf7d5cb67c146895df63ceaa58707e3b147d6630","observation_id":"047cc0eb-30a7-45a8-8844-a72b6c9746ff","resolution":{"observed_at":"2026-08-16T10:59:50.547899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.528097Z","title":"Semantic compositional networks for visual captioning,","venue":null,"work_id":"3828be47-ea29-469e-b2f3-e65e7ea5456b","year":2017},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.266726Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:a2f5f2523b9173b27e3cd907de0d7361bd2b62db0c3b2b1f40e154260c20d626","observation_id":"2539ab21-cf4c-4897-af52-1c6f36889711","resolution":{"observed_at":"2026-08-16T10:59:50.532672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.271127Z","title":"Knowing when to look: Adaptive attention via a visual sentinel for image captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.271127Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:a223c6afbeaae78644eb6622a026a4d7ff727e89d6846158eb082c3e7a49a578","observation_id":"d3c9ac04-1a96-4481-91db-d5ecbfc99201","resolution":{"observed_at":"2026-08-16T10:59:50.271127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.275779Z","title":"Self- critical sequence training for image captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.275779Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:6cfe7d2b48d3253e2b0edba2331a6a81db62b16530fe76fed3b1ffb57c2331a0","observation_id":"595b87ea-c349-4863-a98d-25d380a7d535","resolution":{"observed_at":"2026-08-16T10:59:50.275779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.494780Z","title":"Gatecap: Gated spatial and semantic attention model for image captioning,","venue":null,"work_id":"0e973665-e7ed-42ed-bdc5-3a13c8a9b64b","year":2020},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.281535Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:ae76e73fd010176cd6a9360d44b48940a74d5c55453b3b011f6ff8b56bdc179f","observation_id":"ad6fd4ab-682f-4b6a-9040-8e04d72780f4","resolution":{"observed_at":"2026-08-16T10:59:50.499479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.479216Z","title":"Boosting image captioning with attributes,","venue":null,"work_id":"277292aa-7ab8-488e-9bb8-b3057706581f","year":2017},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.285739Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:40de8a084512999b49e2c7bc0f4dbb6e2df656834b44f2e72b635bdd6927af85","observation_id":"8df0a377-a171-43a8-bd92-ff17314d8f73","resolution":{"observed_at":"2026-08-16T10:59:50.484054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.290298Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.290298Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:c3c0744461ee35ebc9405effe41f9fa124cf709ddf780fb9397d5a2b83c8dbe0","observation_id":"60dbf035-3441-4005-a563-33243def2958","resolution":{"observed_at":"2026-08-16T10:59:50.290298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.454016Z","title":"Recurrent fusion network for image captioning,","venue":null,"work_id":"f308aa38-4cbb-43ef-9617-107e12ebdc28","year":2018},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.294473Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:7d07c1685a01ac7dba1dc3076a16c4f50eb10178b715b3e57d683287ad5fc584","observation_id":"212a3d8d-5a4a-4043-8042-a318f2f89b10","resolution":{"observed_at":"2026-08-16T10:59:50.459200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.437791Z","title":"Exploring visual relationship for image captioning,","venue":null,"work_id":"9f8a1685-033c-48e7-a8ba-58c1927b32e7","year":2018},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.298918Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:8a177c789976d95aac1203f497010744e2f1a2d362f017c8db56fe97e5bf15fd","observation_id":"42127f5c-5451-4bfd-b3d8-0973b8a6c1b3","resolution":{"observed_at":"2026-08-16T10:59:50.443247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.423301Z","title":"Auto-encoding scene graphs for image captioning,","venue":null,"work_id":"c0f29989-336d-4ff4-a19e-daaffab0eace","year":2019},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.303322Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:60e794f72886148550c1adcb8e53a16c138cc2ec4d26ab0518982b72e651e0fd","observation_id":"f280bec8-dabd-4509-b03a-5d18894cfa55","resolution":{"observed_at":"2026-08-16T10:59:50.428184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.408887Z","title":"Attention on attention for image captioning,","venue":null,"work_id":"d59503e5-5ba5-4adf-88e6-2910f24e38ec","year":2019},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.307714Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:8aa0df3d6fa27a48988cb06a1a6df87a7fa5ff5ef15a18f01df973e0080298b5","observation_id":"1c866516-02e6-4314-b6e8-65afb39f6aad","resolution":{"observed_at":"2026-08-16T10:59:50.413370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.392978Z","title":"Image captioning using vision encoder decoder model,","venue":null,"work_id":"d90cd7e5-1877-4cd1-9b48-658a0fcf0431","year":2024},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.312099Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:cb303f01d04ac23f62a76b360adc8b2f5ecd43ca457289a042e51da29cf643d0","observation_id":"d2ab1097-61cb-4866-aae6-f7430c5de033","resolution":{"observed_at":"2026-08-16T10:59:50.398123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:59:50.375979Z","title":"Optimal trans- formers based image captioning using beam search,","venue":null,"work_id":"17c4b7ad-fea5-4a35-b2dd-b776889fb0f7","year":2024},"citing_paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:59:50.316255Z"},"links":{"citing_paper":"/paper/2504.16761"},"observation_digest":"sha256:b3aca675367c1186198dde5f5c2768bf8870fdb044a1f87c395d948250f53467","observation_id":"4a49fa3d-0689-4799-897d-a967c9f2188b","resolution":{"observed_at":"2026-08-16T10:59:50.383025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16761","last_updated":"2025-04-23T14:33:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T19:29:41.144159Z","submitted_at":"2025-04-23T14:33:29Z","title":"Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2504.16761."}