🤖 모델 & 제품 (10/30건)
GPT-6.1 Sol 공개
Astra 표준 API 입출력 토큰 가격의 5분의 1 수준으로 코딩, 컴퓨터 이용(Computer Use), 전문 업무에서 Astra급 성능을 제공하는 GPT-6.1 Sol을 만나보세요.
DevDay 2026 요약 정리
GPT-6 Astra, ChatGPT, Codex, API, 보안 및 빌더를 위한 신규 도구를 포함한 OpenAI DevDay 2026의 20여 개 주요 발표 소식을 확인하세요.
Dots(도츠) 소개
OpenAI의 Dots는 복잡한 프로젝트와 일상 업무를 지속적으로 지원하는 능동형 AI 어시스턴트입니다. 작업이 진행되는 동안 주도권을 유지할 수 있도록 돕는 Dots의 활용법을 알아보세요.
프론티어 AI 훈련 안전성 평가(Safety Cases) 체계 구축을 향하여
프론티어 AI 훈련의 안전성 평가를 위한 초기 가이드라인으로 기술적 보호 조치, 운영 실무, 미정렬(Misalignment) 사고 조사 방안을 제시합니다.
호주를 위한 OpenAI의 개선 및 지원 방안
OpenAI는 호주 정부 웹사이트와 관련된 사고에 대해 사과하고, 호주의 사이버 방어력 강화를 위한 더 강력한 안전 조치 및 지원 계획을 발표했습니다.
렌페스트 인스티튜트, OpenAI의 전폭적인 지원으로 대표 프로그램 확장
OpenAI가 500만 달러 규모의 펀딩과 최대 500만 달러의 소프트웨어 크레딧 및 엔지니어링 지원을 통해 'Lenfest AI Collaborative and Fellowship Program'을 확대합니다.
Future Vision XPRIZE 수상작 예고편 'The Gifted' 감상하기
Future Vision XPRIZE 수상작 예고편인 'The Gifted'를 시청해 보세요.
Team Bots: 팀의 업무 방식을 학습하는 AI 동료
Grok Bot에 필요한 파일, 애플리케이션 및 도메인 지식을 제공하고 공유하여 팀 전체가 동일한 컨텍스트를 기반으로 협업할 수 있도록 지원합니다.
라이브 아바타를 지원하는 Gemini 3.8 Live 공개
실시간 상호작용이 가능한 Live Avatar 기능을 탑재한 Gemini 3.8 Live를 소개합니다.
Claude, 새로운 효소 시스템 발견
새롭게 출범한 생명과학 연구소의 초기 성과로, Claude 에이전트들이 아직 기능이 명확히 규명되지 않은 완전히 새로운 효소 시스템을 발견했습니다.
🌎 업계 동향 (12/172건)
샘 알트만 "OpenAI 모델 안전성 확보 전까지 상장(IPO) 없다"
수개월간 이어진 상장 시점 논란에 대해 샘 알트만 CEO는 모델 안전성을 명확히 보장할 수 있을 때까지 상장은 없을 것이라며, 확정된 일정은 없다고 밝혔습니다. 그는 AI 발전을 지속하되 모델 성능의 급격한 도약에 발맞춘 안전 기준이 우선되어야 함을 강조했습니다.
웹 및 모바일 대화형 AI 에이전트의 개인정보 보호 분석 [pdf]
Hacker News (점수: 407점, 댓글: 129개)
일론 머스크의 xAI, OpenAI의 'Dots' 출시에 맞춰 도메인 선점으로 '도발'
OpenAI가 화요일 신규 AI 에이전트 'Dots'를 공개하기 전, 일론 머스크의 xAI가 이미 'dot.com' 도메인을 확보해 Grok 챗봇 다운로드 페이지로 리디렉션되도록 설정한 것으로 나타났습니다.
OpenAI, GPT-6.1 Sol 공개… Astra급 성능을 1/5 가격에, 초당 300토큰 초고속 티어 지원
OpenAI가 코딩, 컴퓨터 이용, 전문 업무 영역에서 플래그십 GPT-6 Astra에 준하는 성능을 내면서도 토큰 비용은 1/5에 불과한 업그레이드 모델 'GPT-6.1 Sol'을 공개했습니다. 초당 300토큰을 처리하는 신규 'Ultrafast' 티어도 함께 선보였습니다.
복잡한 생물학 연구를 위해 설계된 AI 연구 시스템, Quine 소개
복잡한 생명과학 및 생물학 연구 과제를 해결하기 위해 설계된 AI 연구 시스템 Quine을 소개합니다. (출처: Source)
AI를 비용이 아닌 자산으로 만드는 법
고객들이 AI 비용을 논할 때 대화는 대개 토큰 단가로 시작해 클라우드 내 최신 최고 성능 모델 도입으로 귀결되곤 합니다. 과연 항상 그 수준의 역량이 필요할까요? 반드시 그렇지는 않습니다. 그러나 논의는 종종 그런 방향으로 흘러갑니다. AI가 실험 단계를 넘어 실제 프로덕션으로 전환됨에 따라 모델 선택은 단지...
이제 선도 AI 연구소들에 대한 조사가 필요한 때
지난 수개월간 대표적인 두 곳의 프론티어 AI 연구소는 매우 대담한 행보를 보여왔습니다. 이는 치밀하게 계획된 일련의 발표들로부터 시작되었습니다... 더 읽기
MicroLLM Lab – 브라우저에서 실행해보는 7가지 초소형 LLM
WebGPU를 활용해 브라우저에서 완전 온디바이스로 Q4 양자화 소형 언어 모델을 구동해 보세요. PetitGPT, SmolLM2 등을 온디바이스 환경에서 채팅하고 벤치마크하며 비교할 수 있습니다.
"통제 불능(Rogue)" AI 에이전트란 없다
AI 에이전트를 '통제 불능'으로 규정하는 것은 OpenAI와 같은 기업들에게 면죄부를 주는 일일 뿐입니다.
DeepSeek 탄력적 컴퓨팅 (DSec)
대형 언어 모델(LLM)을 활용한 대규모 에이전트 학습 및 평가는 모델이 저장소를 검사하고, 도구를 호출하며, 명령을 실행하고, 작업별 서비스와 상호작용하는 격리된 스테이트풀(stateful) 실행 환경에 의존합니다. 이러한 워크로드는 대규모 샌드박스를 일시적으로 대량 생성하고, 이기종 기능 및 격리 요구 사항을 포괄하며, 긴 상호작용 전반에 걸쳐 상태를 유지하고 재사용이 제한적인 대규모 이미지 코퍼스를 활용합니다. 따라서 이를 지원하기 위해서는 탄력적인 실행 환경이 필수적입니다.
Meta, Meta에서 촬영 후 Meta AI 안경에 대한 비판적인 영상 삭제
해커 뉴스 (314점, 149개 댓글)
마이크로소프트, 1만 2천 개 계정 탈취한 AI 기반 해킹 플랫폼 무력화
마이크로소프트가 대규모 계정 탈취를 더 빠르고 손쉽게 수행할 수 있도록 엔드투엔드로 지원하던 AI 해킹 플랫폼 'EvilTokens'를 무력화했습니다.
🛠️ 도구 & 오픈소스 (6/37건)
NVIDIA Kumo Tabular, 테이블형 데이터 예측의 정확도와 효율성 기준 경신
단순 사실을 넘어 출처까지 검증: MCP 에이전트를 위한 출처 인지형 검증 기법
앤트로픽 프론티어 레드팀(Anthropic Frontier Red Team) 인용
[내부 바이너리 익스플로잇 벤치마크]에서 무작위 추출한 100개 과제를 여러 모델로 평가한 결과, GLM-5.3은 테스트의 4%에서 완전한 제어 흐름 탈취(Control Flow Hijack)를 성공시켰고 Claude Mythos Preview는 6%에서 성공했습니다. GLM-5.3의 성능이 Claude Mythos Preview에는 못 미치지만, Claude Opus 4.6이나 GLM-5.2 같은 이전 모델들이 단 하나도 통과하지 못한 점을 감안하면 의미 있는 임계점을 넘어선 것이 분명합니다. — 앤트로픽 프론티어 레드팀, GLM
GPT 6.1 Sol: 1/5 가격으로 구현한 Astra급 지능
Hacker News의 'GPT 6.1 Sol: 1/5 가격의 Astra급 지능'에 남긴 코멘트. 키노트 라이브 블로깅 때문에 펠리컨(SVG 렌더링 벤치마크) 게시가 다소 늦었습니다: https://simonwillison.net/2026/Sep/29/openai-devday-2026-liv... GPT-6.1-Sol의 펠리컨 결과는 다음과 같습니다: https://tools.simonwillison.net/markdown-svg-renderer?url=ht... 기존 GPT-6 계열 펠리컨들과 크게 다르지 않습니
OpenAI DevDay 2026 라이브 블로그
오늘 샌프란시스코 포트 메이슨에서 열리는 OpenAI DevDay에 참가했습니다. 작년과 마찬가지로 키노트 및 종일 주요 소식을 라이브 블로그로 중계할 예정입니다. OpenAI로부터 무료 티켓과 키노트 '크리에이터' 구역 좌석을 제공받았습니다. 태그: ai, openai, generative-ai, llms, coding-agents, live-blog, openai-devday
초보자를 위한 GitHub Copilot 앱 가이드: 캔버스로 커스텀 워크플로 구축하기
원하는 인터페이스를 일상 언어로 설명하면, 에이전트가 사용자와 협업 및 업데이트가 가능한 실시간 캔버스 서피스를 생성합니다. 도구에 적응하는 시간을 줄이고 핵심 작업에 더 집중해 보세요. (출처: The GitHub Blog)
📚 논문 & 연구 (17/117건)
FurE: 동물 털 데이터셋 없이 구현하는 효율적인 인스턴스 맞춤형 3D 털 복원
다중 뷰 이미지로부터 사실적이고 편집 가능한 동물 털을 복원하는 작업은 미세한 디테일, 자체 가림(self-occlusion), 그리고 인체 모발과 달리 동물 털 전용 데이터셋이 부족하다는 점에서 큰 도전 과제입니다. 본 연구에서는 루트 조건부 잠재 필드를 최적화하여 가닥(strand) 단위의 편집 가능한 모발을 효율적으로 복원하는 'FurE' 프레임워크를 제안합니다.
망원형 언어 모델 (Telescopic Language Models)
배포된 하나의 언어 모델은 다양한 연산 예산(compute budget)을 충족해야 하지만, 기존 방식은 각 예산 지점마다 별도의 훈련이나 압축 과정을 거쳐야 했습니다. 본 연구는 이러한 연속성을 제공하는 망원형 언어 모델(TLM)을 제안합니다. 풀 앵커(full anchor) 기반의 확률적 접두사 지도를 통해 중첩 용량 트랜스포머를 훈련하여 단일 아티팩트로 다양한 가변 용량을 지원합니다.
교차 강화학습을 통한 통합 모델의 네이티브 자기반성 학습
통합 멀티모달 모델은 이미지를 보고 렌더링할 수 있어, 이미지의 오류를 진단하고 수정하며 결과를 관찰하고 다시 진단하는 자가 수정 과정을 수행할 수 있습니다. 수정이 실제로 도움이 되었는지는 렌더링 후에만 확인할 수 있으므로, 반성 텍스트와 이미지 생성은 전체 루프에 걸쳐 공동으로 학습되어야 합니다. 반성 궤적에 대한 지도 미세조정(SFT)은 콜드 스타트를 제공하지만 성공률이 높은 수정 경로를 찾지 못하며, 단순한 RL은...
TokenCast: LLM 에이전트 실행 중 토큰 소비량 예측
거대언어모델(LLM) 에이전트가 동일한 작업을 실행할 때 실행마다 토큰 소비량이 10배 이상 차이 날 수 있습니다. 에이전트는 툴 피드백과 중간 결과를 기반으로 다음 단계를 결정하며, 컨텍스트가 늘어남에 따라 이후 호출의 입력 크기도 지속적으로 증가합니다. 따라서 실행 전에는 작업의 총 토큰 소비량을 예측하기 어렵고 실행 과정에 맞춰 예측을 수정해야 합니다. 본 논문에서는 조합 가능한 비용 모델을 학습하는 TokenCast를 제안합니다.
MoE를 루프 구조로 만드는 법: 전문가 평탄화와 어텐션 분리
루프 트랜스포머(Looped Transformer)는 레이어 블록을 여러 번 재사용하여 고정된 크기의 모델 파라미터를 더욱 효율적으로 활용하며, 희소 전문가 혼합(MoE) 모델은 각 토큰마다 소수의 전문가만 활성화합니다. 루프형 MoE는 이 두 설계 철학을 결합하여 MoE의 전문가 활용도를 높일 새로운 잠재력을 제공하지만, MoE를 어떻게 루프화할 것인가라는 질문을 낳습니다. 본 연구에서는 Foil을 통해 이 해법을 제시합니다.
KV-streams: 에이전트 강화학습을 위한 효율적 컨텍스트 압축
에이전트 LLM의 실행 주기를 확장하는 데 있어 GPU 메모리에 길어지는 컨텍스트 추적 데이터를 담아야 한다는 점이 병목이 됩니다. 컨텍스트 압축은 메모리를 일정하게 유지해 이를 완화하는 가장 대중적인 방식입니다. 그러나 기존 압축 방식의 대부분은 LLM 컨텍스트를 여러 번 프리필링(prefilling)해야 하므로 학습 처리량을 저해합니다. 본 논문에서는 이러한 병목을 해소하고 효율적이며 학습 가능한 압축을 실현하는 플러그 앤 플레이 방식의 KV-streams를 제안합니다.
PDMD: 비디오 디퓨전 모델을 위한 투영 분포 매칭 증류
최신 비디오 디퓨전 모델은 긴 시공간 토큰 시퀀스에 대해 수십 번의 노이즈 제거(디노이징) 연산을 요구합니다. 분포 매칭 증류(DMD)는 함수 평가 횟수(NFE)를 몇 번으로 대폭 줄이지만, 학습 중 샘플 품질이 저하되어 과포화나 아티팩트가 심화되는 문제가 발생합니다. 본 연구는 이러한 불안정성의 원인을 학생 모델의 연속 업데이트에 축적되는 크리틱(critic) 오류로 규명하고, 이를 필터링하는 PDMD를 제안합니다.
단일 단계 시각 생성을 위한 분포 학습의 통합적 프레임워크
분포 학습(Distributional training)은 동결된 표현 공간에서 실제 특징과 생성된 특징을 매칭하여 1단계(One-Step) 시각 생성에 집합적 지도 학습을 제공합니다. 본 논문은 분포 모델링을 매칭 오차와 분리하고 바서슈타인 그래디언트 흐름을 통해 전역 목적함수를 점별(pointwise) 특징 업데이트와 연결하는 통합 이론 프레임워크를 소개합니다.
복합 적응 제어를 위한 수축 동역학적 표현의 통계적 학습
동역학적으로 결합된 외란 하에서의 복합 적응 추종 제어를 위한 표현 학습 프레임워크를 제안합니다. 이 프레임워크는 고전적인 외란 수용 제어(DAC)와 최근의 마지막 레이어 적응형 외란 제거 기법을 연결합니다. 구체적으로, 칼만 스무더를 하드 E-스텝에 사용하는 통계 기반의 하드 기댓값-최대화(hard-EM) 절차를 도입하여 잠재 진화가 균일하게 수축하는 외란의 동역학적 표현을 규명합니다.
신경 조화 측도 연산자: 가변 형상 도메인을 위한 타원형 편미분방정식 신경 해석기
가변 형상 도메인에서 타원형 편미분방정식(PDE) 문제를 해결하기 위한 신경 해석기인 NHMO(Neural Harmonic Measure Operator)를 제안합니다. 도메인의 조화 측도는 경계 데이터와 적분되어 디리클레 라플라스 해를 반환하는 경계 확률 분포로, 경계 데이터가 아닌 기하학적 구조에만 의존합니다. NHMO는 이 측도의 밀도를 트랜스포머 기반 경계 커널로 파라미터화합니다.
적응형 루프 트랜스포머를 통한 테스트 타임 스케일링 개선
루프 트랜스포머는 잠재 연산에 레이어를 재사용함으로써 뛰어난 파라미터 효율성을 보여주었습니다. 기존 연구들은 동일한 파라미터나 토큰당 FLOPs 조건에서 루프 모델과 비루프 모델을 비교해 왔으나, 출력이 길어질 때 루핑이 테스트 타임 스케일링을 개선하는지는 충분히 탐구되지 않았습니다. 사후 학습된 루프 트랜스포머를 통해 디코딩 FLOPs 증가 대비 정확도 향상률(정확도-연산 기울기)을 분석합니다.
하네스 학습을 통한 일반화 가능한 테스트 타임 적응
언어 모델 에이전트는 모델 자체와 모델 호출, 도구 사용, 정보 흐름을 체계화하는 실행 프로그램인 '하네스(harness)'의 결합으로 정의됩니다. 작업마다 이러한 작업을 구성하는 최적의 방식이 다르기 때문에, 실행 피드백을 기반으로 하네스를 적응시켜야 합니다. 본 연구에서는 실행 피드백을 활용해 솔버의 하네스를 수정하도록 제안자(proposer) 모델을 학습시키는 '하네스 학습'을 제안합니다.
카렌 블릭센의 <일곱 개의 고딕 이야기> 속 성경 간텍스트성 참조 검색
원문이 패러프레이징, 암시, 고어, 번역 등을 거쳐 변형될 경우 간텍스트적(intertextual) 참조를 식별하는 문학 연구 작업은 계산적으로 매우 까다롭습니다. 본 논문에서는 카렌 블릭센의 <일곱 개의 고딕 이야기>에 나타난 성경 간텍스트성을 통해 이 문제를 조사합니다. 비판판 주석을 바탕으로 189개의 주석 참조 벤치마크를 구축하고, 덴마크어 구약 및 신약의 31,170개 전 구절을 대상으로 검색 성능을 평가합니다.
서사 상태 추적을 통한 장편 스토리 생성 스케일링
LLM은 창의적 글쓰기에서 강력한 역량을 입증해 왔습니다. 그러나 서사의 일관성을 유지하기가 점차 어려워짐에 따라, 이를 장편 소설 수준으로 확장하는 것은 여전히 도전 과제로 남아 있습니다. 기존의 스토리 생성 방식은 대개 1만 단어 내외의 이야기에 집중되어 있어 장편 소설로 확장하는 능력은 충분히 연구되지 못했습니다. 본 연구에서는 LLM이 구조화된 서사를 추적할 수 있도록 돕는 학습 불필요 에이전트 프레임워크인 NstAgent(Narrative State Tracking Agent)를 제안합니다.
언어 에이전트의 효율적 소통 기반 사회적 지능을 향하여
사회적 지능을 갖춘 언어 에이전트는 대화 참여자 모두의 시간과 주의 집중을 배려하면서 협상, 조율 및 상충되는 선호도를 해결해야 합니다. 상대방의 제약 사항을 다루고 목표를 달성할 만큼의 정보를 충분히 전달하면서도 불필요한 단어를 줄여야 하므로 이러한 균형을 맞추는 것은 까다롭습니다. 본 논문에서는 통신 비용을 줄이면서 사회적 목표 달성률을 높여 주는 TACT(Teacher-Assisted Communication Training)를 제안합니다.
나이트 사이언스를 통한 과학적 아이디어 창출에서의 에이전트 창의성 강화
대규모 언어 모델(LLM)은 구조화되고 검증 가능한 작업에는 뛰어나지만, 낮은 엔트로피 편향으로 인해 획일적이고 예측 가능한 결과물을 만들어내 개방형 과학적 아이디어 창출에는 한계가 있습니다. 그러나 효과적인 발견은 구조화된 '데이 사이언스(주간 과학)'부터 기존의 통념을 뛰어넘는 아이디어에 닿는 느슨하게 구조화된 우연적 '나이트 사이언스(야간 과학)'에 이르기까지 폭넓은 창의적 스펙트럼에 걸쳐 있습니다. 본 연구에서는 강화학습을 통해 모델을 학습시키는 에이전트 프레임워크인 AI Night-Sci
개인화 생성에 대한 재고: 분해 랭킹 모델을 통한 테스트 타임 정렬
단일하고 획일화된 사용자를 최적화하는 표준 정렬 패러다임은 LLM을 다양한 사용자 선호에 정렬하는 데 근본적인 걸림돌이 됩니다. 본 연구에서는 먼저 실증적 연구를 통해 테스트 타임 정렬(Test-Time Alignment)을 통한 개인화 생성에 아직 활용되지 않은 방대한 성능 잠재력이 존재함을 밝힙니다. 또한 개인화 생성이 기본적으로 후보 매칭 문제로 볼 수 있기 때문에 Best-of-N(BoN)과 같은 테스트 타임 스케일링 기법에 매우 적합함을 입증합니다.
⚖️ 정책 & 안전 (5/14건)
맥도날드, 버거 가격 책정에 AI 동적 가격제 도입
맥도날드가 미국 전역 및 일부 글로벌 시장의 메뉴 가격 결정을 위해 인공지능을 점점 더 많이 활용하고 있습니다. 이는 본사 수익 증대를 목표로 하지만 고객 이탈 및 반독점 규제 조사의 위험을 안고 있습니다.
챗봇이 정부 관료주의의 미로를 해결할 수 있을까? 백악관의 실증 시험
America.gov는 정부 행정 절차를 간소화하는 것을 목표로 하지만, 대규모 언어 모델(LLM)의 불완전성과 지속적인 환각(hallucination) 문제로 인해 새로운 혼선을 야기할 수 있다는 우려도 제기됩니다.
트럼프, 미 행정부에 AI 대신 '슈퍼 인텔리전스' 명칭 사용 지시
도널드 트럼프 미국 대통령의 새 행정명령에 따라 미 행정부는 더 이상 '인공지능(AI)'이라는 명칭을 사용하지 않습니다. 앞으로 정부 공식 웹사이트, 정책 문서, 보도자료 등에는 '슈퍼 인텔리전스(Super Intelligence)'라는 용어만 쓰이게 됩니다.
Import AI 474: 플라톤적 정신 공간, 우주 속의 TPU, 지푸(Zhipu)의 외부 재귀적 자기개선(RSI) 루프
LLM의 한계 역량을 뛰어넘는 지점은 어디일까요?
고정 가중치 모델의 적대적 취약성과 그에 따른 정렬(Alignment) 실패
본 글은 고정 가중치(fixed-weight) 모델이 최소한 현재 이해되는 구조상 a) 개념 공간 내 적대적 예제(adversarial examples)에 항상 취약하며, b) 따라서 충분한 최적화 압력이 주어질 경우 필연적으로 정렬 실패(misalignment)가 발생할 수밖에 없다고 주장합니다. 개념 공간의 경계: AI가 어떤 목적을 수행하든, 세계 모델 내부에서 세계 A와 세계 B를 구분하고 비교하기 위한 경계를 설정해야 합니다. AI가 우리의 목표와 가치를 따르도록 하려면...
🎥 영상 & 튜토리얼 (3/10건)
Jev: 화제를 모으고 있는 새로운 패러다임의 AI 모델
단어를 생성하지 않는 AI 모델이 등장했습니다. Typesafe AI가 개발한 'Jev'는 문단이나 코드를 생성하는 대신 곧바로 의사결정 단계로 넘어갑니다. 텍스트 대신 선택지, 점수, 참/거짓 등의 결과를 출력합니다. 이로 인해 압도적인 속도와 극도로 저렴한 비용을 자랑하며, 입력 비용은 100만 토큰당 단 4센트부터 시작하고 출력은 측정하기 어려울 정도로 저렴해 무료로 제공됩니다.
DHH의 논란 발언: 코딩의 종말과 개발자의 미래
DHH가 1,200명의 Rails 개발자들 앞에서 '손으로 직접 코드를 작성하는 시대는 끝났다'고 선언했습니다. AI 시대에 여전히 가치를 지니는 핵심 프로그래밍 역량이 무엇인지 살펴봅니다.
Claude Opus 5.5 AI: 놀라운 도약
Anthropic의 Claude Opus 5.5가 공개되었습니다. 생명체 보행 시뮬레이션 및 유체(꿀) 코일링 실험 등 복잡한 물리·생물학적 시뮬레이션 연구와 결합된 최신 AI 모델의 성능 발전과 한계점을 짚어봅니다.