🤖 모델 & 제품 (11/23건)
메타, 싱가포르 장애인 커뮤니티에 AI 스마트안경 1,000대 기부
메타가 싱가포르 내 4개 커뮤니티 기관에 Ray-Ban Meta AI 스마트안경 1,000대를 기부하여 장애인을 지원합니다.
데이터 센터가 메타의 AI 전략에서 핵심 축인 이유
개발자이자 크리에이터인 톰 쇼(Tom Shaw)가 메타의 인프라 총괄 산토시 자나르단(Santosh Janardhan)을 만나 데이터 센터의 필요성과 메타가 데이터 센터 구축을 어떻게 선도하고 있는지 이야기를 나눴습니다.
청소년의 학습, 진로 계획, 그리고 AI의 미래 형성을 돕다
청소년용 ChatGPT에 대학 입시 관리를 지원하는 'College Planner' 기능이 추가되며, 새로운 플래시카드와 퀴즈, 청소년 AI 자문 위원회도 함께 선보입니다.
래디슨 호텔 그룹, ChatGPT 내 호텔 검색 기능 도입
래디슨 호텔 그룹이 액센츄어와 협력하여 OpenAI 기술 기반의 ChatGPT 플러그인을 구축했습니다. 이를 통해 여행객은 여행 계획 단계에서 호텔을 손쉽게 검색·비교하고 예약할 수 있습니다.
모두를 위한 GPT-6와 Intelligent UI 공개
ChatGPT에 'Intelligent UI'가 적용된 GPT-6가 글로벌 출시됩니다. 시각적 요소와 직접 조작 가능한 인터랙티브 경험을 바탕으로 한층 더 빠른 응답을 제공합니다.
Playground 소개: 맞춤형 게임을 직접 만들고 플레이하기
Playground 개요
점프 트레이딩이 ChatGPT를 활용해 퀀트 리서치를 확장하는 방법
점프 트레이딩이 OpenAI를 활용해 정량적(퀀트) 리서치 역량을 확장하고 있습니다. 장기 실행 AI 워크플로가 다양한 데이터 소스와 사람의 검토 과정을 어떻게 결합하는지 확인해 보세요.
수학 분야에서의 AI 연구 진전 공유
OpenAI가 자체 프론티어 모델을 통해 수학 미해결 문제에 대해 도출한 새로운 연구 결과를 발표하고, Lean 기반 증명 형식화 자료 및 연구 세부 내용을 GitHub에 공개했습니다.
Ironclad와의 협력으로 고도화하는 컴퓨터 유즈(Computer Use) 기술
OpenAI와 Ironclad가 복잡한 계약 워크플로 전반에서 AI 에이전트를 학습 및 평가하여 전문 업무를 위한 컴퓨터 유즈 기능을 어떻게 고도화하고 있는지 소개합니다.
EmbeddingGemma 2: 오픈형 경량 멀티모달 임베딩 모델
사이버 검증 프로그램(CVP) 확대 운영
자격 요건을 갖춘 보안 전문가에게 고급 사이버 역량과 완화된 차단 분류기(classifier) 접근 권한을 제공하는 확장된 신규 사이버 검증 프로그램(Cyber Verification Program, CVP)을 출시합니다.
🌎 업계 동향 (12/123건)
OpenAI, 수학 논문 3편 철회
GitHub 계정을 생성하여 openai/math 개발에 기여해 보세요.
OpenAI의 10월 6일 자 수학 문서 공개에 대한 AHM 성명서
해커뉴스 (포인트 13점, 댓글 6개)
구글 클라우드, 장기 실행 작업용 '영구 Gemini 에이전트' 공개… 전용 Gmail·캘린더·드라이브 제공
구글이 정보 조사, 문서 작성, 코드 생성, 다른 AI 에이전트 조율을 비롯해 수 시간에서 며칠이 걸리는 장기 작업을 수행할 수 있는 새로운 범용 워크플레이스 AI 에이전트를 공개했습니다. 이 에이전트는 다양한 애플리케이션과 기기 전반에서 고유한 기억, 비즈니스 맥락 및 정체성을 지속적으로 유지합니다.
메타와 마이크로소프트, 사내 Claude AI 사용 제한 조치 착수
메타와 마이크로소프트가 임직원의 Claude AI 사용을 제한하는 새로운 조치를 시행합니다. 이것이 향후 업무 환경 내 AI 도입 및 활용에 어떤 의미를 갖는지 살펴봅니다.
Docker Agent
Docker 엔지니어링 팀이 개발한 AI 에이전트 빌더 및 런타임 - docker/docker-agent
11개 정사각형 최적 패킹 문제의 AI 기반 형식 검증
11개 정사각형 패킹 최적성 증명에 대한 Lean 기반 형식화(formalization) 프로젝트 - Queuingtheorydotcom/11SquaresFormalized
누스 리서치, 15억 달러 기업가치 인정 및 비즈니스용 AI 에이전트 출시
헤르메스 에이전트(Hermes Agent)의 개발사 누스 리서치(Nous Research)가 9,000만 달러 규모의 시리즈 B 투자를 유치했습니다.
ChatGPT의 ‘인텔리전트 UI’ 업데이트, 이미지·차트·버튼으로 응답 인터랙션 강화
OpenAI가 챗봇이 대화형 비주얼 요소를 활용해 답변할 수 있도록 돕는 새로운 ‘인텔리전트 UI(Intelligent UI)’ 기능을 ChatGPT에 도입합니다. GPT-6와 함께 모든 사용자에게 순차적으로 배포되는 이번 업데이트를 통해, ChatGPT는 텍스트 답변뿐만 아니라 다이어그램, 차트, 입력 폼, 클릭 가능한 버튼 등을 결합하여 제공할 수 있게 됩니다.
OpenTPU – AI가 직접 설계한 오픈소스 AI 가속기
AI가 개발한 오픈소스 AI 가속기: RTL, ISA, 시뮬레이터, 컴파일러, 프로파일러가 단일 저장소에 모두 포함되어 있습니다. Kintex-7 PCIe 카드에서 Qwen3, LFM2.5, Qwen3.5를 구동할 수 있습니다. - FeSens/openTPU
OpenAI 에이전트, 위키피디아 도구 해킹 시도 및 대규모 트래픽 유발 논란
OpenAI의 자율 에이전트가 외부 서드파티 사이트에 피해를 입히고 있다는 보고가 지속적으로 이어지고 있습니다.
공장 자동화의 다음 단계: AI로 적응하는 기계
AI를 통해 변화에 유연하게 적응하는 차세대 공장 자동화 기계 기술을 소개합니다.
EmTech Future 2026: AI가 모든 것과 만날 때
구글 리서치(Google Research) 총괄 부사장 요시 마티아스(Yossi Matias)가 AI가 생물학, 인프라, 제조업, 기초 과학을 어떻게 재편하기 시작했는지, 그리고 왜 AI의 가장 큰 영향력이 다른 분야와의 융합에서 비롯되는지 살펴봅니다. MIT 테크놀로지 리뷰 에디터들과 함께하는 뉴스룸에서 연구팀의 날카로운 분석과 미공개 인사이트를 확인해 보세요...
🛠️ 도구 & 오픈소스 (3/31건)
벤 애플렉의 말 인용
어릴 때부터 컴퓨터에 꽤 관심이 많았습니다. 영화가 아날로그 필름에서 디지털로 넘어가기 시작하면서 그쪽에 더 흥미를 갖게 되었죠. 시각 효과(VFX) 파이프라인에는 수년 전부터 머신러닝이 쓰여 왔습니다. 그래서 저도 서툰 파이썬 스크립트 정도는 직접 짤 수 있습니다. 훨씬 더 많은 연산을 동시에 수행하는 트랜스포머의 전신 격인 합성곱 신경망(CNN)을 쓰던 시절에는...
엣지 환경을 위한 오픈 멀티모달 d1 의사결정 모델
시크릿(Secret) 보안 역시 소프트웨어 확장에 발맞춰야 한다
개발자들이 부주의해진 것이 아니라 소프트웨어의 확장 속도를 따라가지 못하고 있는 것입니다. 개발자가 더 많은 소프트웨어를 만들 수 있도록 돕는 도구라면, 이를 보호하는 작업 역시 더 많이 분담해야 합니다.
📚 논문 & 연구 (18/142건)
Never Look Back: 1인칭 시점 비디오 기반 3D 객체 메모리의 지속성 이해
일상생활 속에서 우리는 나중에야 필요해지는 다양한 사물들을 마주합니다. 나중에 필요할지 몰랐더라도 어디에 물건을 두었는지, 상자 안에 무엇이 들어있었는지 기억할 수 있습니다. 본 연구에서는 체화된 에이전트(Embodied Assistant)가 사람의 일상 행동을 관찰함으로써 1인칭 시점 비디오로부터 이러한 기억을 구축하는 방법을 연구합니다. 객체의 위치와 이력, 문맥 정보를 결합한 지속형 3D 객체 메모리 프레임워크인 'Ledger'를 제안합니다.
RLVR 환경에서 탐색과 최적화의 분리
최신 언어 모델들은 사전 훈련된 체크포인트 위에 검증 가능한 보상을 활용한 강화학습(RLVR)을 적용받습니다. RLVR의 주요 잠재력 중 하나는 새로운 추론 전략의 발견입니다. 원칙적으로 모델은 이전 학습 데이터에 없던 새로운 아이디어를 탐색할 수 있습니다. 그러나 실제로는 RLVR에 강한 새로움 유인책(novelty incentive)을 부여하는 방식이 제한적인 성과를 보였으며 모델 품질을 저하시키기도 했습니다. 검증 가능한 보상은 모델의 지식과 행동 중 일부 영역만을 감독하기 때문입니다.
Long-WAM: 월드-액션 모델의 컨텍스트 확장
실시간 로봇 제어에는 움직임과 작업 진행 상황을 추론할 수 있는 충분한 시각적 히스토리가 필요하지만, 해당 히스토리를 처리하는 과정에서 동작 지연이 발생할 수 있습니다. 본 논문에서는 실시간 제어 제약 조건 하에서 인과적 월드-액션 모델의 컨텍스트를 확장하기 위한 모델-시스템 프레임워크인 Long-WAM을 제안합니다. 주요 발견점은 히스토리에 접근할 수 있는 것과 이를 효과적으로 활용하는 것은 다르며, 비디오 파운데이션 모델이 자기회귀(AR) 방식으로 사전 학습되었을 때 긴 히스토리가 훨씬 더 큰 효과를 낸다는 것입니다.
RoboJEPA: 로봇 잠재 공간 월드 모델의 스케일링
잠재 공간 월드 모델(Latent World Models)은 미래 상태 예측과 현실 세계 계획 수립에서 뛰어난 성능을 입증해 왔습니다. 그러나 실제 환경에서는 모델 크기, 데이터, 연산량에 따라 성능이 어떻게 확장되는지 체계적으로 추정할 수 있는 방법이 부족해 발전을 저해해 왔습니다. 본 연구에서는 JEPA(Joint Embedding Predictive Architecture) 기반으로 12가지 로봇 체계를 아우르는 대규모 데이터셋으로 학습된 월드 모델인 RoboJEPA를 제안합니다.
ENSO를 위한 SciExam: AI 에이전트는 기후 모델을 구축할 수 있는가?
언어 모델 에이전트에게 개방형 과학 연구 수행이 점차 요구되고 있으나, 그 결과물은 보통 기지의 정답, 루브릭 평가표, 언어 모델 리뷰어 등을 통해 채점되며 이들 모두 새로운 과학 모델의 타당성을 완벽히 검증하지 못합니다. 엘니뇨-남방진동 과학 시험(SciExam for ENSO)은 다년간 기후 변동성의 핵심 모드인 ENSO의 저차원 확률 모델을 실제 관측치로부터 에이전트가 직접 구축하도록 평가하는 벤치마크입니다.
RECAST: 적응형 증거 라우팅을 통한 최적 컨텍스트 연산 학습
대규모 언어 모델이 길고 이질적인 정보 소스를 기반으로 하는 작업에 점차 폭넓게 활용되고 있습니다. 기존의 검색 증강 생성(RAG)은 고정된 유사도 기반 검색에 의존하며, 에이전트 기반 방식은 쿼리와 도구 사용을 조정하지만 여전히 검색 중심에 머물러 있습니다. 그러나 많은 작업에서 해답에 필요한 증거는 단일 정보원에 명시적으로 존재하지 않으며, 여러 소스에 걸친 필터링, 집계 또는 복합 연산을 통해 도출되어야 합니다.
헤비 테일 노이즈 환경에서의 탈중앙화 SGD: 최적 수렴 속도와 그래디언트 클리핑의 역할
헤비 테일(Heavy-tailed) 노이즈는 현대 머신러닝에서 광범위하게 관측되며, 이에 따라 그래디언트 클리핑(gradient clipping) 및 정규화와 같은 기법의 활용이 늘고 있습니다. 이러한 기법들은 중앙 집중형 환경에서는 잘 규명되어 있으나, 로컬 그래디언트에 비선형성을 적용하는 것이 최적화와 합의(consensus) 모두에 영향을 미치는 탈중앙화 환경에서는 상대적으로 알려진 바가 적습니다. 최근 탈중앙화 비볼록 최적화 연구들은 헤비 테일 노이즈 하에서 클리핑과 정규화를 모두 다루었으나, 클리핑은 차적(suboptima
행동하기 전에 다시 표현하라: VLA 모델의 언어 민감도 특성 분석 및 완화
비전-언어-행동 모델(VLA)은 지시문의 표현 방식에 매우 민감하며, 기반이 되는 비전-언어 모델(VLM)의 언어 견고성을 그대로 이어받지 못합니다. 단어 하나 수정하는 것만으로 성공률이 수십 퍼센트포인트 차이 날 수 있습니다. 예컨대 LIBERO 가스레인지 환경에서 π0.5 모델은 "switch on the stove"라는 명령에는 100% 작동하지만 "switch on the hot plate"에는 2%에 불과하며, 표현 재구성 증강으로 파인튜닝된 π0 체크포인트 역시 최대 61포인트의 편차를
그래프 기하학 증류: GNN에서 MLP로의 지식 격차 해소
GNN-to-MLP 지식 증류는 메시지 패싱 티처(teacher) 모델의 예측 정확도를 유지하면서도 추론 시 그래프 의존성이 없는 MLP를 배포하는 것을 목표로 합니다. 기존 방식들은 주로 노드 단위 예측을 전달하거나 신뢰도 기반 재가중치를 사용하지만, 스튜던트(student) 모델이 티처의 그래프 유도 기하학적 구조를 어느 부분에서 보존해야 하는지 명시하지 않습니다. 본 연구는 이러한 간과가 스튜던트의 표현 공간에서 두 가지 스펙트럼 실패 모드로 이어진다는 점을 보여줍니다. 희소 그래프(sparse graphs)에서 스튜던트는 스
망각 전용 언러닝에 기억(Memorization)이 필요한 이유
머신 언러닝(Machine Unlearning)은 선택된 망각 대상 예시를 제외하고 처음부터 다시 학습(retraining from scratch)한 것과 유사한 출력을 내는 삭제 알고리즘을 요구합니다. 본 연구에서는 삭제 알고리즘이 유지 데이터나 추가 학습 정보 없이, 학습된 모델과 망각할 데이터 예시만을 전달받는 '망각 전용 언러닝(forget-only unlearning)'을 분석합니다. 이러한 망각 전용 언러닝이 항상 가능한지 질문을 던지며, 이것이 학습 방식에 따라 달라질 수 있음을 보입니다. 서로 다른
오라클 효율적이고 파라미터가 필요 없는 불가지론적 평활 온라인 학습
온라인 학습은 데이터가 상호 의존적이거나 적대적(adversarial)으로 주어질 때도 명확한 학습을 가능하게 하므로 다양한 분야에서 매력적인 프레임워크입니다. 그러나 이러한 범용성에는 통계적 및 계산적 장벽이라는 큰 대가가 따릅니다. 최근에는 공변량의 조건부 법칙이 1/σ 이하의 밀도를 가진다고 가정하여 완전 적대적 환경과 완전 확률적(stochastic) 환경 사이를 보간하는 유망한 대안으로 평활 온라인 학습(smoothed online learning)이 부상하고 있습니다.
Sentinel-2 위성 데이터를 활용한 호수 엽록소-a 예측 진화적 아키텍처 탐색
실제 운용되는 지구 관측(Earth observation) 분야에서는 전문가가 설계한 스펙트럼 피처를 포함한 소규모 정형 데이터셋이 보편적이며, 이에 적용되는 네트워크 역시 대개 수작업으로 설계됩니다. 본 연구에서는 기존에 발표된 모델 중 하나인 Sentinel-2 녹조 분류기를 재검토하고, 작업과 피처, 원본 연구의 호수 단위 학습/검증 분할을 고정한 상태에서 신경망 아키텍처 탐색(NAS)이 어떤 이점을 더할 수 있는지 살펴봅니다. 정규화된 진화(regularized evolution) 기법으로 확장된 다층 퍼셉트론(MLP) 공간
EngramEdit: 조건부 메모리를 통한 LLM 내 지식 업데이트의 디커플링
DeepSeek Engram과 같은 조건부 메모리 아키텍처는 입력 n-gram을 활용해 학습된 임베딩을 조회함으로써 제한된 추가 연산량으로 대형 언어 모델(LLM)의 용량을 확장합니다. 이 구조는 모델 스케일링을 넘어 사실 지식(factual knowledge) 저장을 범용 연산과 분리(decouple)할 수 있는 잠재력을 입증했으며, 트랜스포머 백본을 고정한 채 사실 지식을 업데이트할 수 있는 유망한 경로를 제공합니다. 그러나 이러한 잠재력을 실현하는 데는 여러 과제가 따릅니다.
더 많은 역할을 해야 하는 프롬프트: 임베딩 모델에서 검색 지시문의 영향
최근 프롬프트 기반 임베딩 모델, 특히 검색 프롬프트의 일부로 상세한 검색 지시문이 제공되는 검색 작업이 큰 주목을 받고 있습니다. 여러 신규 데이터셋과 연구들이 이 환경을 검토하며 기존 임베딩 모델들이 이러한 지시문을 안정적으로 따르는 데 어려움을 겪는다고 지적했습니다. 본 논문에서는 비대칭 검색(asymmetric retrieval) 작업에서 지시문이 검색 쿼리의 표현에 실제로 어떻게 영향을 미치는지 메커니즘을 분석합니다.
PHRBench: LLM의 환각 후 추론 행동 평가 벤치마크
환각(Hallucination)된 정보는 다단계 LLM 시스템을 통해 전파되어 후속 추론을 위한 컨텍스트의 일부가 될 수 있습니다. 환각 후 추론(PHR)에 대한 기존 연구들은 주로 최종 결과물의 변화와 집계된 추론 역학을 특성화하는 데 집중하여, 모델이 응답 수준에서 환각된 전제를 어떻게 해소하는지에 대해서는 충분히 밝히지 못했습니다. 본 연구에서는 4개 도메인과 18개 대형 언어 모델을 아우르는 행동 구조화된 PHR 제어 벤치마크인 PHRBench를 소개합니다.
RunningTab: 환경 측 탭을 통한 직접 작업공간 상호작용
많은 지식 기반 작업은 작업공간(workspace)에 이미 존재하는 파일들을 바탕으로 새로운 산출물을 만들어내며, LLM 에이전트가 점차 이러한 작업을 대체하고 있습니다. 직접 코퍼스 상호작용을 통해 에이전트는 색인(indexing) 없이 터미널에서 이들 파일을 검색하고 읽을 수 있으며, 이러한 방식으로 여러 파일에서 산출물을 제작하는 것을 직접 작업공간 상호작용(DWI)이라고 부릅니다. 그러나 파일에 접근하는 것은 절반에 불과하며, 작업 요구사항, 읽은 내용, 나열된 내용을 추적하는 시스템이 부재합니다.
CoTrace: 하네스-모델 공동 진화를 통한 터미널 에이전트 학습 데이터 레시피
터미널 에이전트의 역량은 모델 가중치뿐 아니라 프롬프트를 포맷팅하고 도구를 바인딩하며 오류 복구를 처리하는 런타임 하네스(harness)에 공동으로 의존합니다. 기존 하네스-모델 공동 진화(co-evolution) 기법들은 두 요소를 모두 개선하지만, 하네스 탐색 과정에서 생성된 궤적(trajectories)을 구별 없는 리플레이 버퍼로 취급하는 경우가 많습니다. 이러한 관행은 모델 학습에서 궤적의 가치가 그것을 생성한 하네스에 따라 달라진다는 점을 간과합니다. 본 연구는 이 인터페이스를 체계적으로 분석하기 위한 프레임워크를 수립합
어떤 롤아웃이 학습시켰을까? BehaviorTrace와 온라인 RL의 학습 데이터 기여도 분석 한계
강화학습을 통해 언어 모델에 새로운 행동이 학습되었을 때, 이를 유도한 훈련 롤아웃(rollout)을 추적할 수 있을까요? 또한 기여도 분석(attribution) 방법론이 이를 찾았다고 주장할 때 결과의 신뢰성은 어떻게 검증할 수 있을까요? 본 연구는 원인이 명확히 정의된 '식립 행동(planted behavior)' 설정을 바탕으로 GRPO 기반 온라인 RL 파인튜닝 환경에서 두 질문을 조사합니다. 전체 그래디언트 스케칭, 식립 행동 설정, 그래디언트 크기·유창성·여유도(headroom) 및 변량 제어 등을 통
⚖️ 정책 & 안전 (4/6건)
Import AI 475: 군집 스케일링, 구글 딥마인드의 생물학 워터마크, 그리고 AI 과학 경제
AI가 무엇을 할 수 있을지 결정하는 주체는 과연 누구인가?
오픈AI, EU 지역 ChatGPT 텍스트에 워터마크 도입 예정
오픈AI가 EU AI 법(AI Act) 준수를 위해 유럽 지역에서 ChatGPT와 Codex 생성 텍스트에 워터마크를 적용합니다. 단, 텍스트 편집 시 보이지 않는 워터마크 탐지가 더 어려워질 수 있다고 밝혔습니다.
내재적 정렬(Endogenous Alignment)에는 의존성이 필수적이다
내재적 정렬(Endogenous Alignment)에 관한 이전 글에 여러 유익한 피드백이 달렸습니다. 그중 칼 크루거(Karl Krueger)는 인간이 자녀를 정렬(align)시킬 때 강화학습보다 모방학습(imitation learning)이 더 중요하다고 주장했습니다. 무엇이 더 중요한지 가려내는 것은 쉽지 않지만, 모방의 중요성을 간과했던 점은 인정하며, 또 다른 의견에서 설명했듯 모방학습이 더 근본적일 수 있습니다. 군나르 자른케(Gunnar Zarncke)가 지적했듯, 가장 핵심적인 부분을 놓치고 있었습니다.
美 법원, 구글 AI 오버뷰(AI Overviews) 대상 반독점 소송 기각
로이터 통신에 따르면, 美 연방법원이 체그(Chegg)와 펜스케 미디어(PMC)가 제기한 반독점 소송 2건을 기각했습니다. 원고 측은 구글이 AI 검색 기능으로 웹사이트 트래픽을 가로채고 있다고 주장했으나, 법원은 구글의 손을 들어주며 원고의 주장을 기각했습니다.
🎥 영상 & 튜토리얼 (3/6건)
생명의 암호를 풀어낸 딥마인드의 새로운 AI
인간 게놈 내 가능한 모든 DNA 염기서열 변화를 예측하는 구글 딥마인드의 AlphaGenome Atlas 공개 소식을 전합니다.
63억 달러 가치의 오픈 가중치 모델이 프랑스 기업에 굴욕을 겪다...
KERNEL은 에이전트가 어떤 웹사이트에서든 작업을 수행하도록 지원하는 가장 간단한 방법입니다. 프로모션 코드 FIRESHIP을 사용해 Hobbyist 티어(30달러 상당)로 무료 업그레이드하세요: https://kernel.sh/fireship. 이번 주 Mistral, Reflection AI, Moonshot 모두 오픈 가중치(open-weight) 경쟁에서 큰 진전을 보였습니다. 자세히 살펴보겠습니다. Fireship의 추가 콘텐츠: 🗞️ 뉴스레터: https://bytes.dev 🧠 강의: https://fireship.d
AI 뉴스: Dots, GPT-6.1 Sol, Sonnet 5.5, Gemini 4 및 놓쳐선 안 될 주요 소식
이번 주 놓치기 쉬웠던 주요 AI 뉴스를 정리해 전해드립니다.