전체 글

AI, Graphics, Vision 등 Deep-tech 연구자 성낙준입니다. 줌챗, 연구 제안 등은 언제나 이메일로 환영합니다. (njsung@hs.ac.kr / njsung1217@gmail.com)
개발/AI

[프론티어 모델 리뷰] 대화형 AI에서 자율 추론 & 에이전트의 시대로

Introduction2026년 4월, 인공지능 시장은 단순한 성능 경쟁을 넘어 구조적 패러다임의 전환점에 서 있습니다. 최근 벤치마크 플랫폼에서 덕테이프(Duck Tape)라는 별칭으로 불리는 OpenAI의 미공개 모델이 압도적인 성능을 보이며 차세대 프론티어 모델에 대한 기대감을 높이더니, 한국 시간 4월 22일에 "ChatGPT Image 2.0" 이라는 이름으로 정식 출시가 되었습니다. 앤트로픽은 지난 4월 15일 Claude Opus 4.7을 출시하며 코딩과 에이전트 작업 수행 능력을 한 단계 더 끌어올렸습니다. 지난 1~2년이 텍스트 생성의 정확도를 높이고 이미지와 음성을 통합하는 멀티모달(Multimodal) 경쟁의 시기였다면, 현재는 특정 복잡한 태스크에 최적화된 태스크 핏(Task-..

개발/AI

Deep Research + NotebookLM을 활용한 연구 주제 도출하기

AI HUB를 이용해 사용 가능한 데이터 조사하기선정한 데이터셋은 자연 발화 동영상-인체 3D 포즈 데이터셋 입니다(Link) 조사한 데이터의 데이터 시트, 소개서를 활용해 NotebookLM으로 가능한 연구 주제를 도출하기다양한 방향으로 프롬프트를 입력해보며, 연구 주제를 도출[프롬프트]이 데이터를 활용해 수행할 수 있는 연구 주제를 도출해봅시다.[결과물]제시해주신 '자연 발화 동영상-인체 3D 포즈 데이터'는 동양인의 체형과 발화 특성을 반영하고 있으며, 음성, 표정, 동작을 통합적으로 다루고 있어 매우 다각적인 연구가 가능합니다. 이 데이터를 활용해 도출할 수 있는 주요 연구 주제는 다음과 같습니다.1. 동양인 특성 맞춤형 멀티모달(Multimodal) 감정 인식 모델 연구연구 내용: 기존 서양 중..

개발/AI

🚀MedGemma-1.5 업데이트

안녕하세요. njsung입니다. 오늘은 구글(Google)에서 공개한 의료 특화 오픈 모델, MedGemma(메드젬마) 시리즈의 최신 업데이트 소식을 정리해 드리려고 합니다. 바로 지난 1월 13일 공개된 MedGemma 1.5 버전입니다. 기존 1.0 버전이 의료 멀티모달 AI의 가능성을 보여주었다면, 이번 1.5 버전은 실제 임상 현장의 복잡한 데이터를 처리할 수 있도록 기능이 대폭 확장되었습니다. 2D 이미지를 넘어 3D 볼륨 데이터와 시계열 분석까지, 과연 어떤 점이 달라졌는지 핵심만 뽑아 정리해 드립니다. MedGemma 1.5: 무엇이 달라졌나? (Overview)MedGemma는 구글의 Gemma 3 아키텍처를 기반으로 의료 데이터(텍스트, 이미지, EHR 등)를 집중 학습시킨 모델입니다. ..

개발/일반

[Blender] 시뮬레이션 결과를 OBJ 시퀀스로 예쁘게 렌더링하기 (ft. Stop Motion OBJ)

시뮬레이션 결과를 OBJ 파일 시퀀스로 뽑아냈는데, 블렌더(Blender)로 가져와서 렌더링하려니 막막하셨나요?프레임별로 쪼개진 OBJ 파일을 하나의 애니메이션으로 합치고, 실크(Silk) 느낌의 고급스러운 머테리얼을 적용해 렌더링하는 방법까지 한 번에 정리해 드립니다.필수 준비물: Stop Motion OBJ (무료)블렌더 기본 기능으로는 수백 장의 OBJ 파일을 애니메이션으로 연결하기가 매우 번거롭습니다.이를 해결해 주는 'Stop Motion OBJ' 애드온을 사용하면 클릭 한 번으로 해결됩니다.다운로드: GitHub 배포 페이지에 접속합니다.파일 받기: 최신 버전의 Source code (zip) 파일을 다운로드합니다. (Gumroad에서는 유료지만, 깃허브에서는 오픈소스로 무료입니다.)설치: B..

개발/AI

Qwen3-VL-8B-Instruct 파인튜닝 코드

Qwen3-VL-8B-Instruct 파인튜닝 코드를 정리해봤습니다. 커스텀 데이터를 사용하는지라, 데이터 로드(load_data 함수) 부분은 각자 데이터에 맞게 변경이 필요합니다.참고만하시면 됩니다. 0. Library 준비pip install transformers # >= 4.57.0pip install datasets peft trl qwen_vl_utilspip install torch # related by Personal CUDA Version(e.g., CUDA 12, 13, ...)pip install PIL numpy tqdm json random # 필수는 아닐수도있음 transformers는 가장 최신의 버전을 추천합니다.pip install --upgrade pippip inst..

개발/AI

한국형 독자 파운데이션 모델 정리(소버린 AI, Foundation Model)

안녕하세요. 오늘은 지난 2025년 12월 30일, 서울 코엑스에서 있었던 대한민국 인공지능 역사에 남을 중요한 발표 내용을 정리해 드리려고 합니다. 바로 과학기술정보통신부와 NIPA가 주관한 '독자 AI 파운데이션 모델(Foundation Model)' 프로젝트의 1차 성과 발표회 소식입니다.구글, 오픈AI 등 글로벌 빅테크에 종속되지 않고 우리만의 '소버린 AI(Sovereign AI)'를 갖추기 위해 출범한 이 프로젝트가 과연 어떤 결과물을 내놓았는지, 5개 컨소시엄별 특징과 허깅페이스(Hugging Face) 링크까지 핵심만 쏙쏙 뽑아 정리해 드립니다.K-Foundation Model 사업 개요이 사업의 정식 명칭은 '독자 AI 파운데이션 모델 확보' 사업입니다. 2025년부터 본격적으로 시작된 ..

개인/라이프로그

2025년을 돌아보며

2025년을 돌아보며 일적인 부분과 가정적인 부분에 대해 짤막하게 회고를 남겨보려한다. [Job]2024년 박사를 졸업하고, 연구계로 돌아가기 위해 포닥을 시작했다. 2025년 1년은 정말 쏜살같이 시간이 지나간 것 같다.1년간 의료인공지능 분야를 연구하면서 실패도 많이 해보고 비교적 괜찮은 연구도 수행해보고 정말 괜찮은 연구 결과도 뽑아보고 다양한 시행착오를 겪은 것 같다. 서브미션만 줄기차게하고 아직 퍼블리시된 페이퍼가 없는게 아쉽지만 그래도 좋은 연구를 많이 해봤다는 것에 의의를 두고 있다.좋은 PI분을 만나고, 좋은 공동연구진분을 만나는건 포닥생활하면서 정말 운이 좋았다고 생각하고, 그 덕에 2025년의 마무리를 잘 해낸 것 같다.2026년에는 새로운 자리에서 새로운 연구자로 발을 내딛으려하는데,..

개발/AI

[NeurIPS 2025] 인공지능 트렌드를 바꿀 핵심 연구 논문 Best 3 정리 (RL, Vision, GenAI)

최근 몇 년간 인공지능 학회, 특히 NeurIPS(신경정보처리시스템학회)에서 발표되는 연구들은 단순히 학문적인 성과를 넘어 실제 산업계의 트렌드를 좌우하고 있습니다. 특히 2025년에는 그동안 언어 모델(LLM)에만 집중되었던 'Scaling Law(거대화의 법칙)'가 강화학습과 비전 분야로 확장되는 흐름이 뚜렷했습니다. 이번 글에서는 NeurIPS 2025 및 최근 시즌에 공개된 연구 중, 현업 연구자와 개발자가 반드시 주목해야 할 핵심 논문 3편을 선정하여 그 특징과 의의를 정리해보려고 합니다. [NeurIPS Highlight 선정 기준]수많은 논문 중 다음 세 가지 기준에 부합하는 연구를 선정했습니다.기존의 고정관념을 깬 새로운 아키텍처인가?실제 성능 향상 폭이 압도적인가?현업에서 바로 응용 가..

njsung
NJSUNG BLOG